方法論 · AI MEDIAZ REPORT
今回のベンチマークの限界
各製品1回、プラン情報の欠落、AI採点など、結果を解釈する際の制約を公開します。
1回実行のばらつき
各製品・各タスクは1回だけです。偶然の検索結果や生成の揺らぎを平均化できていません。
プラン・モード
表示されたプランやモードが不明な記録では、同じ製品でも条件差が残ります。今後は画面表示と実行設定をより厳密に保存します。
AI二重審査
AI二重審査は人間の専門家評価ではありません。2評価者が同じ偏りを持つ可能性もあります。
次版で改善すること
今回の順位はBenchmark v1.1の9回答をv1.2-AIで採点した結果です。次版では複数回実行、分散、失敗率、所要時間、費用も比較します。
次に読む次回は何回実行すべきか →