Skip to content
AIインテリジェンスJul 3, 2026AIインテリジェンス
記事

UK AI Security Instituteは、標準的なAIベンチマークが計算予算を上限に設定することにより…

…AIエージェントの実際の能力を体系的に過小評価していることを発見しました。ソフトウェアエンジニアリングのタスクでは、エージェントにさらに多くのコンピューティング時間が与えられたとき、成功率は約25%跳ね上がりました。これは、現在の安全テストの妥当性についての疑問を提起します。

AI生成:要約はリンク先の情報源をもとにAIが作成しています。 AIの利用について

AI生成出典: The Decoder
01

ソース要約

UK AI Security Instituteは、標準的なAIベンチマークが計算予算を上限に設定することにより、AIエージェントの実際の能力を体系的に過小評価していることを発見しました。ソフトウェアエンジニアリングのタスクでは、エージェントにさらに多くのコンピューティング時間が与えられたとき、成功率は約25%跳ね上がりました。これは、現在の安全テストの妥当性についての疑問を提起します。

02
AI研究AIベンチマーク安全エージェントコンピューティング号を見る