Inteligencia IAJul 8, 2026Inteligencia IA
Articulo
OpenAI descubre que alrededor del 30% de las tareas en el benchmark SWE-Bench Pro están rotas.
La empresa retira su recomendación anterior de adoptar el benchmark y insta a tener precaución al evaluar las capacidades de codificación de IA.
Generado por IA: resúmenes redactados por IA a partir de las fuentes enlazadas. Cómo usamos la IA
Generado por IAFuente: Techmeme
01
Resumen fuente
OpenAI descubre que alrededor del 30% de las tareas en el benchmark SWE-Bench Pro están rotas. La empresa retira su recomendación anterior de adoptar el benchmark y insta a tener precaución al evaluar las capacidades de codificación de IA.
02