AMAI Mediaz
ベンチマーク · AI MEDIAZ REPORT

ChatGPT・Elicit・Consensusを同一条件で比較

9回答を同じ課題・同じ配点で比較した総合結果と、点差が生まれた理由を公開します。

公開 2026-09-19 · AI Mediaz編集部 · Benchmark v1.2-AI

結論:今回の条件ではChatGPTが首位

今回の順位は、ChatGPT 97.5点、Elicit 87.5点、Consensus 85.6点です。3製品を同じ3タスク、同じ入力条件、同じ100点満点の基準で比べました。

3つのタスクで何を測ったか

T1は研究探索30点、T2は固定された5研究の統合35点、T3は公式情報だけを使う主張検証35点です。検索量だけではなく、条件遵守と検証可能性も評価対象にしました。

点数をどう読むべきか

総合首位はChatGPTですが、T2ではElicitが35点で満点でした。製品名だけで選ぶより、自分の作業に近いタスク別結果を見る方が実用的です。

今回の比較で言えないこと

各製品・各タスクは1回のみです。モデル更新、検索インデックス、プラン、実行時刻による変動を含むため、絶対的な性能順位とはみなしません。