Technik

Warum sich KI-Compute gerade vom Vortraining zum Post-Training verschiebt

Bei großen KI-Modellen verschiebt sich der Rechenaufwand. Vor zwei Jahren war Pretraining der klare Mittelpunkt: mehr Daten, mehr GPUs, größere Modelle. Heute landet ein wachsender Teil der Rechenzeit nach dem Grundtraining. Also im Post-Training, bei Reinforcement Learning und vor allem bei der Nutzung im Betrieb.

Das ist mehr als ein technischer Detailwechsel. Es verändert, wo Geld verbrannt wird, wie Modelle besser werden und welche Firmen im Vorteil sind.

Pretraining verliert seine Alleinstellung

Lange war die Logik einfach: Wer das größte Vortraining stemmen kann, baut das stärkste Modell. Diese Phase flacht ab. Der Grund ist nicht, dass Pretraining unwichtig geworden wäre. Es bleibt die Basis. Aber die zusätzlichen Gewinne pro weiterem Trainingsblock sind schwerer zu holen und teurer zu bezahlen.

Deshalb verlagert sich der Fokus. Statt nur das Basismodell immer größer zu ziehen, investieren viele Teams stärker in die Phase danach: Abstimmung auf gewünschtes Verhalten, verstärkendes Lernen, bessere Werkzeugnutzung und mehr Rechenaufwand pro Anfrage.

Post-Training ist keine Kosmetik mehr

Früher wurde Post-Training oft wie Feinschliff behandelt. Inzwischen ist es ein zentrales Leistungsmerkmal. Genau dort werden Modelle auf Antworten getrimmt, die im Produkt wirklich zählen: saubere Formate, längere Gedankengänge, weniger Aussetzer, bessere Nutzung externer Tools.

Vor allem Reinforcement Learning hat diesen Teil aufgewertet. Die verbreitete Hoffnung dahinter: Mit zusätzlicher Optimierung nach dem Vortraining lassen sich Fähigkeiten breiter freilegen, ohne jedes Mal ein viel größeres Basismodell neu zu trainieren.

Das hat Folgen. Fortschritt hängt weniger nur an einem gigantischen Trainingslauf. Er verteilt sich stärker auf viele Iterationen nach dem eigentlichen Foundation-Training.

Der größte Brocken heißt Inference

Noch wichtiger ist der Betrieb. Sobald Millionen Nutzer Anfragen stellen, wird Inference zur Dauerlast. Das gilt erst recht, wenn Modelle mehr Rechenzeit pro Antwort bekommen. Genau hier kommt Test-Time Scaling ins Spiel: bessere Ergebnisse durch mehr Compute während der Antworterzeugung.

Das ist ein echter Paradigmenwechsel. Früher war die Rechnung oft: viel Compute vorab, danach Antworten möglichst billig ausliefern. Jetzt gilt öfter das Gegenteil. Ein Teil der Intelligenz wird erst zur Laufzeit eingekauft.

Für Nutzer kann das gut sein. Komplexe Aufgaben profitieren davon. Für Anbieter wird es teuer. Jede bessere Antwort kostet dann nicht einmalig im Training, sondern immer wieder im Produktbetrieb.

Warum das wirtschaftlich so wichtig ist

Wenn Compute aus dem Pretraining in Post-Training und Inference wandert, verschiebt sich der Wettbewerb.

Erstens gewinnen Firmen, die Rechenzentren und Serving gut beherrschen. Nicht nur das Training eines Frontier-Modells zählt, sondern die Fähigkeit, hohe Last effizient auszuliefern.

Zweitens wird die Marge schwieriger. Wer Antworten mit viel Laufzeit-Compute verbessert, erhöht laufende Kosten pro Anfrage. Das kann bei Premium-Produkten aufgehen. Im Massenmarkt wird es schnell eng.

Drittens wird Produktdesign wichtiger. Anbieter müssen entscheiden, wann sich teure Denkzeit lohnt und wann eine schnelle, billigere Antwort reicht. Ein Modell mit mehreren Betriebsmodi ist deshalb oft wertvoller als ein einziges starres System.

Was das für kleinere Anbieter bedeutet

Die Verschiebung ist kein automatischer Vorteil für kleine Labs. Einerseits sinkt die Alleinherrschaft des größten Pretraining-Budgets. Andererseits steigen die Anforderungen an Post-Training-Pipelines, Evaluierung und Inference-Infrastruktur.

Kleinere Anbieter können über Spezialisierung gewinnen: klare Domänen, schlankere Modelle, gezieltes Post-Training. Wer aber bei langen Antworten, Agentenfunktionen oder reasoning-lastigen Workloads mithalten will, braucht trotzdem viel Compute im Betrieb.

Der Hype hat einen harten Kern

Die Debatte rund um den Wechsel von Pretraining zu Post-Training wird teils überzogen geführt. Basismodelle bleiben entscheidend. Schlechte Grundlagen rettet auch aggressives Nachtrainieren nicht. Aber die alte Vorstellung, dass der wichtigste Rechenschub fast komplett vor dem Produktstart stattfindet, passt nicht mehr zur Realität.

Der neue Engpass liegt oft nach dem Pretraining: bei Optimierung, Auswertung und vor allem beim Serving. Genau dort entscheidet sich, ob ein Modell im Alltag nur beeindruckt oder wirklich trägt.

Für die Branche ist das eine nüchterne Nachricht. Der Compute-Hunger sinkt nicht. Er verlagert sich nur. Und das macht KI nicht billiger, sondern auf Dauer eher teurer.