
グーグルは、Android Benchベンチマークの大幅なアップデートを発表しました。開発者によると、バージョン2.0ではモバイルデバイスのAI能力評価の手法が根本的に変更され、単純な二値判定テストに代えて複雑なエンジニアリング課題が導入されています。現在のテストでは、ニューラルネットワークを用いてアプリケーションをゼロから構築し、クロスプラットフォームソフトウェアをAndroidプラットフォームへ移植することが求められます。
最大の変更点は、従来の「合格/不合格」方式の採点システムを廃止したことです。以前は、大規模なコードベースの90%まで移行に成功していても、最終段階でエラーが発生すれば不合格とされていました。新バージョンでは、継続的な進捗スコア制を採用し、全体的な性能、UIのビジュアル忠実度、エラーフリーなリグレッションの有無、フレームワークへの厳密な準拠状況などを総合的に評価します。
ルールの複雑化により、AIのパフォーマンスは急激に低下しています。従来のテストではモデルが容易に90%以上のスコアを獲得していましたが、Android Bench 2.0ではトップの成績ですら大幅に下落しています。現時点で首位はOpenAIのフラッグシップモデルであるGPT‑6 Astraですが、その最高スコアでもタスクの完了率はわずか28%にとどまっています。
グーグルは、新しいアルゴリズムによって現代のAIが抱える明確な限界が浮き彫りになったと主張しています。ニューラルネットワークは基礎的なコード処理には長けていますが、複雑なアーキテクチャの変更やアプリケーションの移植は、最良の言語モデル(LLM)にとっても依然として厳しい課題となっています。
さらに、Android Bench 2.0ではエージェントベースの評価方式を導入しました。グーグルの専門家は、アルゴリズムを孤立してテストするのではなく、AIを実環境と組み合わせて評価しています。これにより、実際の開発現場におけるAIアシスタントのトークン使用状況や性能をより正確に把握できるようになりました。