Zum Inhalt springen
← Alle Beiträge

Von VONA

LLM Fine-tuning: Wenn generische Modelle nicht reichen

Sprachmodelle von der Stange sind gut — aber für spezialisierte Anwendungsfälle braucht es maßgeschneiderte Anpassungen. Ein technischer Erfahrungsbericht.

Die großen Sprachmodelle von OpenAI, Anthropic oder Google sind beeindruckend breit aufgestellt. Sie verstehen Kontext, formulieren flüssig und können in vielen Domänen überraschend tiefgreifend antworten. Doch wer sie ernsthaft in spezialisierten Unternehmenskontexten einsetzt, stößt früher oder später an Grenzen: spezifische Fachterminologie wird nicht konsequent verwendet, Ausgabeformate weichen vom Standard ab, oder das Modell verhält sich in bestimmten Situationen nicht so, wie es ein Domänenexperte erwarten würde. Hier kommt Fine-tuning ins Spiel.

Fine-tuning bedeutet, ein bereits trainiertes Basismodell mit einem kleineren, spezialisierten Datensatz weiterzutrainieren. Das Modell behält sein allgemeines Weltwissen, lernt aber zusätzlich, sich in einem bestimmten Kontext anders zu verhalten — präziser, konsistenter, der Domäne angepasster. Der Unterschied zu Prompt Engineering liegt darin, dass das Verhalten im Modell verankert wird, nicht bei jeder Anfrage neu formuliert werden muss.

Wann Fine-tuning wirklich nötig ist

Die Praxis zeigt: Fine-tuning ist selten der erste richtige Schritt. Bevor man Trainingsdaten zusammenstellt und Kosten für das Training einplant, sollte man ausgeschöpft haben, was gutes Prompt Engineering und RAG leisten können. In vielen Fällen lässt sich das gewünschte Verhalten durch einen sorgfältig formulierten System-Prompt und relevante Kontext-Dokumente erreichen — ohne das Modell selbst anzufassen. Fine-tuning lohnt sich dann, wenn konsistentes Format-Verhalten wichtig ist, das Modell eine spezifische Tonalität verlässlich halten soll, oder sehr viele ähnliche Anfragen mit domänenspezifischen Mustern beantwortet werden müssen.

Ein typisches Praxisbeispiel: Ein technischer Dokumentationsdienstleister trainiert ein kleineres Open-Source-Modell auf tausenden Paaren aus roher Spezifikation und fertig formatierter Dokumentation. Das Ergebnis kann ein Modell sein, das zuverlässig das interne Dokumentationsformat trifft, Fachbegriffe korrekt verwendet und deutlich weniger manuelle Nacharbeit erfordert als das Basismodell — selbst mit aufwändigem Prompting.

Datenqualität ist alles

Die häufigste Ursache für unbefriedigende Fine-tuning-Ergebnisse ist nicht die Architektur oder die Hyperparameter — es sind die Trainingsdaten. Schlechte, inkonsistente oder zu wenige Beispiele führen zu einem Modell, das genauso schlechte und inkonsistente Ausgaben produziert, nur mit mehr Selbstsicherheit. Wir empfehlen, lieber 500 hochwertige, bereinigte Trainingspaare zu verwenden als 5.000 halbgar aufbereitete. Sorgfältige Datenaufbereitung ist zeitaufwendig, aber der Return on Investment ist deutlich höher als beim Training selbst.

  • Datenqualität vor Datenmenge: lieber weniger, aber konsistenter
  • Trainingsdaten müssen das gewünschte Endverhalten abbilden, nicht den Weg dorthin
  • Evaluierung auf einem Holdout-Set ist unverzichtbar
  • Regelmäßiges Re-Training bei sich ändernden Anforderungen einplanen

Fine-tuning ist kein Allheilmittel, aber ein mächtiges Werkzeug im richtigen Moment. Wer den Aufwand nicht scheut und mit sauberen Daten arbeitet, bekommt ein Modell, das in seinem Anwendungsbereich deutlich verlässlicher ist als jede generische Alternative. Für uns ist es ein fester Bestandteil des Werkzeugkastens — neben, nicht statt Prompt Engineering und RAG.

← Zurück zur Übersicht