AMAI Mediaz
検証レポート · AI MEDIAZ REPORT

T3:公式情報だけで7主張を検証する

料金、引用精度、収録論文数などの主張を公式記録だけで分類しました。

公開 2026-09-19 · AI Mediaz編集部 · Benchmark v1.2-AI

課題の設計

7つの主張を、事前に用意した公式記録だけでSupported、Contradicted、Insufficient/Ambiguousへ分類する課題です。

分類の正解

料金表、API仕様、ヘルプセンターなど、主張の種類に対応する一次情報を指定しました。検索で別資料を足すことは認めていません。

ChatGPTの満点

ChatGPT 35.0点、Consensus 33.6点、Elicit 28.5点でした。分類だけでなく、記録ID、公式URL、簡潔な理由、高リスク主張の選定を評価しました。

誤分類が生じたポイント

料金の通貨や月払い価格のように、資料が断定していない部分を推測しないことが重要です。不明を不明のまま残す能力も検証品質に含まれます。