ベンチマークデータセット(HotpotQA, WebQuestions, FEVERなど)

GraphRAGの「実装と実験」においては、モデル性能を評価するためにベンチマークデータセットが不可欠です。GraphRAGは通常のRAGよりも情報の文脈的・構造的関連性を活用するため、複数文書にまたがる推論(マルチホップ推論)やファクト検証などを求められるタスクに適しています。以下に代表的なベンチマークデータセットを紹介します。


1. HotpotQA(Hotpot Question Answering)

  • 目的: マルチホップQA(複数文書にまたがる推論)能力の評価

  • 特徴:

    • 各クエリには少なくとも2つ以上の関連する文書が存在。

    • モデルは、中間的な推論ステップを踏んで答えに到達する必要がある。

    • ゴールドスタンダードとして、関連段落・サポートファクトも提供。

  • GraphRAGとの関係:

    • グラフ構造(文書チャンク同士の関係)を活用して中間情報を統合し、正確な回答に至る能力を検証できる。


2. WebQuestions

  • 目的: オープンドメインQA(質問応答)の基礎的性能評価

  • 特徴:

    • 質問はWebから収集された実際の自然言語形式(例: “Where was Barack Obama born?”)。

    • 回答は**Freebase(構造化知識ベース)**上のエンティティを対象とする。

    • 単一ホップで答えが得られる場合が多い。

  • GraphRAGとの関係:

    • 基本的な情報検索+文書理解に基づくQA性能の下限を測るのに適している。

    • 単一ノードまたはエッジをたどるだけのケースも含まれるため、構造的推論の強さを比較的控えめに測定する用途に向く。


3. FEVER(Fact Extraction and VERification)

  • 目的: ファクト検証(fact verification)タスク

  • 特徴:

    • クレーム(例: “The Eiffel Tower is in Berlin.”)が与えられ、Wikipediaから証拠文を検索して真偽を判定

    • 正しい証拠文が複数必要な場合もある。

    • ラベル: SUPPORTED, REFUTED, NOT ENOUGH INFO

  • GraphRAGとの関係:

    • 複数文書から関連証拠をグラフで結合し、証拠間の関係性を活かした検証が可能。

    • ノードは文や文書単位、エッジは意味的・文脈的な関連性として構築される。


補足:GraphRAGにおけるベンチマーク活用意義

  • ベンチマークを使うことで、以下の点について定量的に比較可能となる:

    • 情報検索の精度(Recall@k, MRR)

    • 生成文の品質(ROUGE, BLEUなど)

    • 事実整合性(factual consistency)

  • 特にGraphRAGでは、従来のRAGモデルに対する性能向上(マルチホップ推論の正解率や事実整合性の改善)を示す上で、HotpotQAやFEVERのような構造的な文書理解が求められるタスクが重要な指標となります。

ChatGPT4o 生成日:2025/06/11