Artikel zu: SWE-bench

3 Artikel

KI-Forschung

ScarfBench: Benchmarking von KI-Agenten für die Migration von Enterprise-Java-Frameworks

ScarfBench führt einen standardisierten Benchmark ein, um KI-Agenten bei der Migration von Enterprise-Java-Frameworks zu bewerten. Es test...

2. Juli 20268 Min.
Anleitungen

Test von Mythos und Fabel: Über SWE-bench hinaus mit Nvidias offenem Herausforderer

Erkunden Sie, wie Nvidias neues Open-Source-Framework die Dominanz des SWE-Bench herausfordert. Lernen Sie, KI-Modelle mit Mythos und Fabl...

20. Juni 20268 Min.
KI-Forschung

Ist es agentisch genug? Benchmarking offener Modelle mit eigenen Tools

Lernen Sie, wie Sie Open-Source-KI-Agenten auf Autonomie und Aufgabenerfüllung mit benutzerdefinierten Benchmarks bewerten. Ein praktische...

18. Juni 20269 Min.