製品レビュー · AI MEDIAZ REPORT
ChatGPTの実測レビュー
97.5点だった回答の強みと、T1で満点を逃した理由を分解します。
総合スコア
ChatGPTはT1 29.0点、T2 33.5点、T3 35.0点で、合計97.5点でした。3種類の課題すべてで大きな崩れがなかったことが首位の理由です。
調査タスクの特徴
T1では条件に合う研究を比較的多く提示し、書誌情報も整理しました。一方、探索課題は検索時点と収録範囲の影響を受けるため、件数そのものを完全性の証明にはできません。
要約と検証の安定性
T2では固定資料だけを使う制約を守り、RCTと観察研究、対象外集団、不確実性を区別しました。細部の省略で1.5点を失いました。
向いている利用者
T3では7主張を公式記録に照らし、支持・反証・不十分を正しく整理して満点でした。汎用AIでも、資料と判定規則を固定すると検証作業に強みが出ます。
次に読むElicitの実測レビュー →