検証レポート · AI MEDIAZ REPORT
T3:公式情報だけで7主張を検証する
料金、引用精度、収録論文数などの主張を公式記録だけで分類しました。
課題の設計
7つの主張を、事前に用意した公式記録だけでSupported、Contradicted、Insufficient/Ambiguousへ分類する課題です。
分類の正解
料金表、API仕様、ヘルプセンターなど、主張の種類に対応する一次情報を指定しました。検索で別資料を足すことは認めていません。
ChatGPTの満点
ChatGPT 35.0点、Consensus 33.6点、Elicit 28.5点でした。分類だけでなく、記録ID、公式URL、簡潔な理由、高リスク主張の選定を評価しました。
誤分類が生じたポイント
料金の通貨や月払い価格のように、資料が断定していない部分を推測しないことが重要です。不明を不明のまま残す能力も検証品質に含まれます。