英語からの翻訳

CommonsenseQAは、日常的な常識知識を用いて推論するAIシステムの能力を評価するために2019年に導入された多肢選択式の質問応答データセットであり、ConceptNetから派生した12,247問の質問を含む。

CommonsenseQAは、人工知能システムの常識推論能力を評価するためのベンチマークデータセットである。2019年にワシントン大学とアレン人工知能研究所の研究者らによって公開され、12,247問の多肢選択問題で構成されており、各問題には正解が1つと誤答の選択肢が4つ含まれている。このデータセットは、既存の自然言語処理ベンチマークにおけるギャップに対処するために設計されたものであり、既存のベンチマークはしばしば事実の想起や構文理解に焦点を当てていたが、モデルが世界についての日常知識を適用する能力を十分にテストしていなかった

CommonsenseQAの質問は、日常概念間の関係を符号化する大規模な意味ネットワークであるConceptNet知識グラフから生成されている。各質問は、「犬は動物である」や「雨のときに傘を使う」といったConceptNetのトリプルに基づいている。データセットの作成者らは、クラウドソーシングのワーカーを用いて、これらのトリプルを自然言語の質問に変換し、もっともらしいが誤った回答選択肢を生成した。このプロセスにより、質問が単純なパターンマッチングや記憶ではなく、真の常識推論を必要とすることが保証される

構築と設計

CommonsenseQAの作成には、多段階のパイプラインが関与した。まず、研究者らは、日常的で一般的な概念を含むConceptNetトリプルのセットを選択した。その後、Amazon Mechanical Turkを用いて、ワーカーに、システムがトリプルから正しい関係を推論できるかどうかをテストする質問を書かせた。各質問について、ワーカーはまた、正解と意味的に関連するが、質問の文脈では誤りである4つの誤答選択肢を生成した。この敵対的設計により、誤答選択肢がしばしばもっともらしいが誤りであるため、ベンチマークは困難なものとなっている

最終データセットは、トレーニングセット、開発セット、およびテストセットに分割された。トレーニングセットには9,741問、開発セットには1,221問、テストセットには1,241問が含まれる。テストセットは公開されておらず、研究者は評価サーバーにモデルを提出して結果を得る必要があり、これにより過学習を防ぐのに役立つ

評価と影響

CommonsenseQAは、大規模言語モデルや他のAIシステムを評価するための標準的なベンチマークとして急速に普及した。初期の結果では、当時の最先端モデル(BERTやGPT-2など)でさえ、ランダム推測(5択の多肢選択タスクでは正解率20%)よりわずかに良いだけの性能しか示さなかった。これは、AIシステムにとって常識推論が困難であることを浮き彫りにした

その後の研究により、性能は大幅に向上した。外部知識を組み込んだモデル(関連するConceptNetトリプルを取得するモデルやグラフニューラルネットワークを使用するモデルなど)は、より高い正解率を達成した。GPT-3やそれ以降のモデルを含む、より大規模な事前学習モデルの導入も、大幅な改善をもたらした。2021年までに、一部のモデルは開発セットで約80%の正解率に近づいたが、人間の性能は約91%と推定されている

他のベンチマークとの関係

CommonsenseQAは、Winograd Schema Challenge、SWAG、HellaSwagを含む、より広範な常識推論ベンチマーク群の一部である。これらのベンチマークが代名詞解決や文完成に焦点を当てているのとは異なり、CommonsenseQAは、多様な日常シナリオを用いた多肢選択質問応答を明示的にテストする。これは、OpenAIAnthropicGoogle DeepMindなどの企業によって開発されたものを含む、汎用AIシステムを評価するために、他のデータセットと併用されてきた

このデータセットはまた、拡張および適応もされてきた。例えば、CommonsenseQA 2.0と呼ばれる変種が2021年に公開され、これは生成的モデルに基づく異なる質問生成アプローチを使用している。さらに、研究者らは、表面的な手がかりに依存するモデルにとって質問が難しくなるように変更された、CommonsenseQAの敵対的スプリットを作成し、モデルの堅牢性をテストしている

限界と批判

その人気にもかかわらず、CommonsenseQAは批判に直面してきた。一部の研究者らは、このデータセットにはバイアスが含まれていると指摘している。例えば、特定の回答選択肢がより頻繁に出現する傾向や、正解がより長いまたはより具体的である傾向がある。モデルは、真の推論を行うことなく、これらの統計的規則性を利用することができる。さらに、質問はすべて英語であり、西洋中心の常識観を反映しているため、他の文化や言語への適用可能性が制限される

もう一つの限界は、このデータセットが静的であること、つまり常識知識の進化する性質を捉えていないことである。世界が変化するにつれて、常識と見なされるものは変化する可能性があるが、ベンチマークは固定されたままである。これにより、一部の研究者らは、より動的で多様な評価方法を求めるようになった

##現在の使用状況

2020年代半ばの時点で、CommonsenseQAは、Artificial intelligenceおよびMachine learning研究コミュニティにおいて広く使用されているベンチマークであり続けている。これは、MMLUやBIG-benchなどの他のベンチマークと並んで、大規模言語モデルの評価スイートにしばしば含まれている。このデータセットは研究目的で自由に利用可能であり、Hugging Faceなどのプラットフォームでホストされているため、研究者がアクセスして使用することが容易である

CommonsenseQAはまた、モデルの推論能力をより詳細に研究するためにも使用されてきた。例えば、研究者らは、どのタイプの常識知識(空間的、時間的、社会的など)がモデルにとって最も困難であるかを分析し、また、Transformer (architecture)ベースのモデルの内部表現を調査するためにこのデータセットを使用してきた。この進行中の研究は、より堅牢で有能なAIシステムの開発に引き続き情報を提供している

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·commonsense-reasoning·nlp·benchmark
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴