Skip to content
Intelligence IAJul 8, 2026Intelligence IA
Article

OpenAI constate que près de 30 % des tâches du benchmark SWE-Bench Pro sont défectueuses.

L'entreprise retire sa recommandation précédente d'adopter le benchmark et appelle à la prudence lors de l'évaluation des capacités de codage de l'IA.

Généré par IA : résumés rédigés par une IA à partir des sources citées. Notre usage de l'IA

Généré par IASource: Techmeme
01

Brief source

OpenAI constate que près de 30 % des tâches du benchmark SWE-Bench Pro sont défectueuses. L'entreprise retire sa recommandation précédente d'adopter le benchmark et appelle à la prudence lors de l'évaluation des capacités de codage de l'IA.