コード修正ベンチマーク「DeepSWE v1.1」のスコアと1タスクあたりコスト。GPT-6 Solは68.8%で、Claude Fable 5の69.9%に届かなかった

コード修正ベンチマーク「DeepSWE v1.1」のスコアと1タスクあたりコスト。GPT-6 Solは68.8%で、Claude Fable 5の69.9%に届かなかった