Google、AIコーディング能力を測る「Android Bench 2.0」公開
AI要約 ITmedia AI+ 元記事を読む
Googleは、AIモデルやエージェントのコーディング能力を評価するための新たなベンチマーク「Android Bench 2.0」を発表しました。この新ベンチマークは、実際のソフトウェアエンジニアが数日を要するような複雑な長期タスクをAIに課すよう刷新されています。その結果、従来のベンチマークで約91%だった最高通過率が、約28%へと大幅に低下しました。
なぜ重要か
この結果は、現在のAIモデルが単体で複雑な開発タスクを完遂する上での限界を定量的に浮き彫りにします。生成AIの能力が注目される中で、AIが現実世界の長期的な問題解決にどのように貢献できるか、そしてどのような課題があるかを明確にする重要な指標となるでしょう。
背景
近年、大規模言語モデルの進化により、AIによるコード生成やバグ修正の能力は飛躍的に向上し、ソフトウェア開発への応用が期待されています。しかし、個別のコードスニペットの生成を超え、複雑なソフトウェア開発プロセス全体をAIが自律的に実行する能力にはまだ大きな隔たりがあるとされていました。このベンチマークは、その現実的なギャップを測る試みと言えます。
今後の注目点
今後、この新たなベンチマークをクリアするために、AIモデルやエージェントがどのように進化していくか、その進捗に注目が集まります。より複雑な、実世界に近い開発タスクに対応できるAIの登場が期待されます。
原題: 「1週間の開発タスク」でAIの限界を検証 Googleが「Android Bench 2.0」公開