LLM Evals
LLM Evals sind die Tests, die messen, ob ein AI-Feature tatsächlich funktioniert — sie prüfen die Modellausgaben gegen erwartete Ergebnisse, Qualitätskriterien oder menschliches Urteil. Sie sind für AI-Produkte, was Unit-Tests für gewöhnliche Software sind: der Weg, zu wissen, dass eine Änderung geholfen hat, statt zu raten.
Da LLM-Ausgaben nicht deterministisch sind und eine Prompt-Änderung einen Fall reparieren, aber fünf andere brechen kann, lässt sich nicht nach Gefühl ausliefern. Evals machen aus «wirkt besser» eine Zahl. Sie reichen von Exact-Match-Prüfungen bei strukturierter Ausgabe über bewertende Punktvergabe durch ein anderes Modell (LLM-as-Judge) bis zur menschlichen Prüfung an einem festen Testset. Vor und nach jeder Änderung ausgeführt, zeigen sie, ob Sie wirklich besser wurden, und fangen Regressionen ab, bevor Nutzer sie merken.
Beim Bau eines Produkts sind Evals der Unterschied zwischen einer Demo und etwas, dem man im Betrieb traut. Die Disziplin: früh ein repräsentatives Testset aufbauen — einschließlich der Fälle, die schon gescheitert sind — und jeden Teil getrennt messen: Abrufqualität, Qualität der Endantwort, Formattreue, Sicherheit. Für uns sind Evals Kern-Ingenieursarbeit, kein Nachgedanke, denn ohne sie ist jede Prompt-Änderung ein Glücksspiel, und «läuft an meinem Beispiel» ist kein Maßstab, mit dem wir ausliefern.
// faq
Häufige Fragen
- Wie evaluiere ich ein LLM-Feature ohne gelabelten Datensatz?
- Klein anfangen und wachsen lassen. Sammeln Sie eine Handvoll echter oder realistischer Fälle mit den Antworten, die Sie akzeptieren würden, und fügen Sie jeden gefundenen Fehler dem Set hinzu. Darauf bauen Sie Exact-Checks für strukturierte Ausgaben, einen LLM-as-Judge für offene Qualität und regelmäßige menschliche Prüfung. Ein bescheidenes, ehrliches Testset schlägt keine Evals und wird mit jedem Fehler besser.
- Warum kann ich AI-Features nicht einfach mit ein paar Prompts testen?
- Weil LLMs nicht deterministisch sind und Änderungen Nebenwirkungen haben — eine Korrektur für eine Eingabe bricht oft still andere, die Sie nicht geprüft haben. Ein paar Prompts sagen nichts über die ungetesteten Fälle. Ein wiederholbares Eval-Set bei jeder Änderung ist der einzige Weg, zu wissen, dass eine Anpassung insgesamt geholfen hat und nicht nur am Beispiel vor Ihnen.