R&D AI Benchmark / Pilot

GPT-5.6 Solは研究開発に使える? R&D実務4テストで検証

公開日: 2026-09-17 | AI Mediaz独自検証

注意:4問だけのパイロット結果です。モデル能力全体や他モデルに対する優位性を示すものではありません。

結果

今回の4テストではGPT-5.6 Solはすべて100点でした。科学的推論、数値計算、交絡の識別、未検証引用の扱いを検証しました。

Test内容Score
V1-001複数測定の矛盾と機構識別100
V1-002多段濃度・質量収支100
V1-003交絡因子と因果推論100
V1-004情報源とハルシネーション100

何が分かったか

001ではDLS平均径と粗大粒子計数が異なる挙動を示すケース、002では既存添加剤を含むベースからの質量収支、003ではPVP濃度と温度が完全に共変するケース、004では内部資料にある未検証引用を扱いました。

4/4満点だったため、現行パイロットは上位モデルを十分に差別化できる難度ではない可能性があります。今後は同一条件で複数モデルを比較し、複合課題も追加します。

採点方法

数値として機械判定できる項目はプログラムで評価し、科学的推論や不確実性などにはルーブリック採点を使用します。現パイロットには回答モデルとJudgeが同一モデルであるケースがあり、これは制約として扱います。

比較対象を順次追加予定

提携サービスが決まった後、この位置に公式サービスへのアフィリエイト導線を設置できます。