検証レポート · AI MEDIAZ REPORT
T2:5研究を250語以内で統合する
外部情報を使わず、RCTと観察研究を区別して要約できるかを比較しました。
課題の設計
架空の5研究カードだけを使い、『Noveraは健康成人の疲労を減らすか』を250語以内で統合する課題です。外部知識の追加は禁止しました。
満点だったElicit
評価対象は研究表の正確さ、RCTと観察研究の区別、対象外集団の指摘、方向性、一貫性、不確実性、適用可能性、安全性です。
ChatGPTの省略
Elicit 35.0点、ChatGPT 33.5点、Consensus 27.5点でした。Elicitは制約内で必要要素を過不足なくまとめました。
Consensusの語数超過と追加情報
この課題は検索力ではなく、与えられた証拠を勝手に補わずに統合する能力を測ります。もっともらしい追加説明も、資料外なら減点対象です。