AA-Omniscience
AA-Omniscienceは、知識と幻覚生成能力を評価するベンチマークテストです。回答の正確性を評価し、不適切な推測にはペナルティを課すことで、各モデルが異なる分野において事実に基づいた信頼性の高い出力を生成できるかどうかを総合的に評価します。
AA-Omniscience: Knowledge and Hallucination Benchmark | Artificial Analysisより翻訳
背景
AA-Omniscienceは、正確性を評価し、不適切な推測を罰するとともに、さまざまな経済関連分野において事実的に信頼性の高い出力を生成するモデルの能力を包括的に評価するベンチマークテストです。本ベンチマークには、権威ある学術論文や業界資料から抽出した6,000問が収録されており、LLMベースの質問生成エージェントを用いて自動的に作成されています。この手法により、質問の曖昧さを排除し、スケーラビリティを確保するとともに、事実精度の高さを実現しています。
#Artificial_Analysis