Quellen: Eval-driven Development

Dieser Knoten hält fest, woher das Wissen für den Guide Eval-driven Development stammt. Die Aufbereitung steht dort; hier liegen die geprüften Originalquellen mit den Kernzitaten.

1. 🎙️ Die Quellen im Überblick

QuelleWerKernbeitrag
Demystifying evals for AI agentsAnthropic Engineeringeval-driven development, pass@k/pass^k, Eval-Bugs
Why we no longer evaluate SWE-bench VerifiedOpenAIKontamination, Benchmark-Sättigung
Emerging Patterns in Building GenAI ProductsMartin FowlerEvals als zentrale Disziplin, Nicht-Determinismus

2. 🧷 Kernaussagen

Anthropic definiert die umgedrehte Reihenfolge und mahnt zur Vorsicht bei der Eval selbst:

“We recommend practicing eval-driven development: build evals to define planned capabilities before agents can fulfill them, then iterate until the agent performs well.” “With frontier models, a 0% pass rate across many trials (i.e. 0% pass@100) is most often a signal of a broken task, not an incapable agent.”

OpenAI begründet, warum öffentliche Benchmarks an Wert verlieren:

“improvements on SWE-bench Verified no longer reflect meaningful improvements in models’ real-world software development abilities. Instead, they increasingly reflect how much the model was exposed to the benchmark at training time.”

(Einordnung: OpenAI ist hier Wettbewerber und bewirbt im selben Post einen Nachfolger, die Analyse ist nicht peer-reviewed. Der Kernbefund Kontamination ist aber breit anerkannt.)

Martin Fowler rahmt das Problem grundsätzlich:

GenAI zwingt uns, “to consider what it means to program with non-deterministic tools.”

3. 🔗 Was daraus kompiliert wurde