ニュース

法務と電気工学に強い「Grok 4.7」、価格は据え置き

1タスクあたりの料金が抑えられるGrok 4.7

 コーディングや長時間のタスクをより粘り強くこなすAIモデルが登場した。SpaceXAIは9月21日(現地時間)、コーディングおよびナレッジワーク向けのAIモデル「Grok 4.7」を発表した。同日よりCursorや「Grok Build」、Grok API経由で利用可能となっている。API価格は入力100万トークンあたり2ドル(約316円、1ドル=約158円換算)から、出力100万トークンあたり6ドル(約948円)から。

 Grok 4.7は、SpaceXAIがコーディングとナレッジワーク向けとして同社でもっとも高性能とうたうAIモデル。前モデル「Grok 4.6」と同じ価格/速度で提供され、同社によれば、同等クラスのモデルと比べて速度は2倍、価格は半分になるという。

 Grok 4.7では、Grok 4.6より大規模な新しいベースモデルを採用したほか、難易度の高いタスクを中心に、より長時間の強化学習を実施した。これにより、自身の作業を検証する能力や、長いコンテキストを管理する能力が向上したとしている。

 また、同社のエージェント「Grok Bot」のハーネスをネイティブに理解するよう学習させ、会話型タスクや一般的なナレッジワークでの性能も高めた。さらに、ドキュメントやプレゼンテーションの作成能力も向上している。

 ベンチマークでは、長時間のコーディングタスクを評価する「CursorBench 4.0」で46.3%を記録し、「GPT-5.6 Sol」を上回った。

 また、専門知識を要する業務での性能を測る「GDPval」、長時間におよぶオフィスワークベンチマーク「AA Briefcase」では、「GPT-6 Astra」をも上回るスコアを記録した。電気工学の「EEBench」では64.0%、法務の「Harvey Legal Agent Benchmark」では19.6%と、比較対象のモデルの中でもっとも高いスコアを記録している。一方、ターミナル作業や臨床推論では他社モデルにリードを譲る。

 安全面では、新たなセーフガード機構を採用。同社が検証したモデルの中で、拒否性能とジェイルブレイク耐性がもっとも高いという。サイバーセキュリティ分野では、悪意あるタスクを評価するベンチマーク「HackerBench v0.3」において、リスクのあるデュアルユースプロンプト通過率を3.3%に抑えつつ、正当なセキュリティ業務はほとんどブロックしないとしている。