実務ソフトでの専門作業を測る「Agents' Last Exam」の正答率とAPIコスト。GPT-6 Astraは59.3%で、Claude Opus 5の55.5%、GPT-5.6 Solの53.6%を上回った

実務ソフトでの専門作業を測る「Agents' Last Exam」の正答率とAPIコスト。GPT-6 Astraは59.3%で、Claude Opus 5の55.5%、GPT-5.6 Solの53.6%を上回った