KI Intelligence08.07.2026KI Intelligence
Artikel
OpenAI stellt fest, dass etwa 30% der Aufgaben im SWE-Bench Pro Benchmark fehlerhaft sind.
Das Unternehmen zieht seine frühere Empfehlung zur Nutzung des Benchmarks zurück und mahnt zur Vorsicht bei der Bewertung von KI-Code-Fähigkeiten.
KI-generiert: Die Zusammenfassungen schreibt eine KI auf Grundlage der verlinkten Quellen. So nutzen wir KI
KI-generiertQuelle: Techmeme
01
Source Brief
OpenAI stellt fest, dass etwa 30% der Aufgaben im SWE-Bench Pro Benchmark fehlerhaft sind. Das Unternehmen zieht seine frühere Empfehlung zur Nutzung des Benchmarks zurück und mahnt zur Vorsicht bei der Bewertung von KI-Code-Fähigkeiten.
02