RAG (Retrieval-Augmented Generation)
RAG ist eine Technik, die zur Laufzeit relevante Fakten aus Ihren eigenen Daten holt und sie einem Sprachmodell vorlegt, bevor es antwortet. So basieren Antworten auf Ihren Inhalten statt auf dem Gedächtnis des Modells. RAG ist der Standardweg, um ein LLM präzise aus privaten oder aktuellen Informationen antworten zu lassen.
Ein blankes LLM kennt nur seine Trainingsdaten, eingefroren zu einem Stichtag und ohne Kenntnis Ihrer Dokumente. RAG löst das: Ihre Inhalte werden in Abschnitte zerlegt, als Embeddings in einer Vector DB gespeichert, zur Frage werden die nächstliegenden Treffer abgerufen und dem Modell als Kontext übergeben. Das Modell antwortet dann aus diesen Belegen statt zu raten — das senkt Halluzinationen deutlich und erlaubt Quellenangaben.
Beim Bau eines Produkts ist RAG meist der erste Griff, bevor jemand Fine-tuning vorschlägt: günstiger, Ihre Inhalte sind sofort nach jeder Aktualisierung aktuell, und Sie können Nutzern genau zeigen, welche Quelle eine Antwort stützt. Das Schwierige ist nicht das Modell, sondern der Abruf — sauberes Chunking, das richtige Embedding-Modell und Evals, die erkennen, wenn das System selbstbewusst aus der falschen Stelle antwortet. Für uns ist die Abrufqualität die eigentliche Ingenieursarbeit.
// faq
Häufige Fragen
- Ist RAG besser als Fine-tuning?
- Für Antworten aus einem Faktenbestand, der sich über die Zeit ändert, meistens ja. RAG hält das Wissen in einer Datenbank, die Sie sofort bearbeiten können, und erlaubt Quellenangaben. Fine-tuning brennt Wissen in die Modellgewichte und muss bei Änderungen neu gemacht werden. Fine-tuning passt besser für Stil, Format oder eine enge Aufgabe — oft kombiniert man beides.
- Warum gibt mein RAG-System trotzdem falsche Antworten?
- Fast immer liegt es am Abruf, nicht am Modell. Landet die richtige Stelle nie im Kontext, kann das Modell sie nicht nutzen. Typische Ursachen: zu große oder zu kleine Chunks, ein schwaches Embedding-Modell, kein Reranking oder fehlende Evals für die Trefferquote. Erst die Abruf-Pipeline reparieren und messen, dann am Prompt arbeiten.
// weitere_begriffe