AMAI Mediaz
検証レポート · AI MEDIAZ REPORT

T2:5研究を250語以内で統合する

外部情報を使わず、RCTと観察研究を区別して要約できるかを比較しました。

公開 2026-09-19 · AI Mediaz編集部 · Benchmark v1.2-AI

課題の設計

架空の5研究カードだけを使い、『Noveraは健康成人の疲労を減らすか』を250語以内で統合する課題です。外部知識の追加は禁止しました。

満点だったElicit

評価対象は研究表の正確さ、RCTと観察研究の区別、対象外集団の指摘、方向性、一貫性、不確実性、適用可能性、安全性です。

ChatGPTの省略

Elicit 35.0点、ChatGPT 33.5点、Consensus 27.5点でした。Elicitは制約内で必要要素を過不足なくまとめました。

Consensusの語数超過と追加情報

この課題は検索力ではなく、与えられた証拠を勝手に補わずに統合する能力を測ります。もっともらしい追加説明も、資料外なら減点対象です。