Grundbegriffe

Inferenz

Inferenz bezeichnet den Moment, in dem eine fertig trainierte KI tatsächlich arbeitet und auf eine Eingabe antwortet. Wenn Sie ChatGPT eine Frage stellen, findet Inferenz statt – das Modell wendet sein gelerntes Wissen an. Inferenz verbraucht deutlich weniger Rechenleistung als das Training, verursacht aber laufende Kosten.

Was bedeutet Inferenz in der KI?

Inferenz bezeichnet in der Künstlichen Intelligenz den Vorgang, bei dem ein bereits trainiertes KI-Modell auf neü Daten angewendet wird, um Vorhersagen oder Ergebnisse zu liefern. Wenn Sie beispielsweise eine Frage an ChatGPT stellen und eine Antwort erhalten, findet in diesem Moment Inferenz statt. Das Modell nutzt sein gelerntes Wissen, um auf Ihre Eingabe zu reagieren.

Der Unterschied zum Training ist grundlegend: Während das Training den aufwendigen Prozess beschreibt, in dem ein Modell aus grossen Datenmengen lernt und seine Parameter anpasst, ist die Inferenz die eigentliche Nutzung dieses gelernten Wissens. Man kann es mit dem Unterschied zwischen Lernen und Anwenden vergleichen: Ein Student lernt jahrelang Medizin (Training), und wenn er dann einen Patienten diagnostiziert, wendet er sein Wissen an (Inferenz).

Wie funktioniert Inferenz technisch?

Bei der Inferenz wird eine Eingabe -- etwa ein Text, ein Bild oder eine Audiodatei -- durch das neuronale Netz geleitet. Die Parameter des Modells, die während des Trainings optimiert wurden, bleiben dabei unverändert. Das Modell berechnet Schicht für Schicht eine Ausgabe, zum Beispiel eine Textantwort, eine Bildklassifikation oder eine Uebersetzung.

Bei Large Language Models wie GPT oder Claude erfolgt die Inferenz Token für Token: Das Modell sagt jeweils das nächste wahrscheinlichste Wort voraus, bis die Antwort vollständig ist.

Edge-Inferenz vs. Cloud-Inferenz

Es gibt zwei grundlegende Ansätze, wo Inferenz stattfindet:

  • Cloud-Inferenz: Das Modell läuft auf leistungsstarken Servern in der Cloud. Sie senden Ihre Anfrage uebers Internet, der Server berechnet die Antwort und schickt sie zurück. Die meisten KI-Dienste wie ChatGPT, Claude und Gemini nutzen diesen Ansatz. Vorteil: Zugang zu den größten und leistungsfähigsten Modellen. Nachteil: Abhängigkeit von Internetverbindung und Datenschutzbedenken.
  • Edge-Inferenz: Das Modell läuft direkt auf Ihrem Gerät -- etwa auf dem Smartphone, Laptop oder einem lokalen Server. Apple Intelligence und einige Funktionen von Google Pixel nutzen diesen Ansatz. Vorteil: Schneller, da keine Netzwerklatenz, und datenschutzfreundlicher, da Daten das Gerät nicht verlassen. Nachteil: Nur kleinere, weniger leistungsfähige Modelle möglich.

Geschwindigkeit und Kosten der Inferenz

Für Unternehmen sind zwei Aspekte der Inferenz besonders wichtig:

Geschwindigkeit: Die Inferenzgeschwindigkeit wird häufig in Tokens pro Sekunde gemessen. Schnelle Modelle erzeugen 100 oder mehr Tokens pro Sekunde, während größere Modelle langsamer sein können. Für Echtzeit-Anwendungen wie Chatbots oder Sprachassistenten ist eine hohe Inferenzgeschwindigkeit entscheidend.

Kosten: Jede Inferenz-Anfrage verbraucht Rechenleistung und damit Geld. Bei API-basierten Diensten zahlen Sie typischerweise pro verarbeitetem Token -- sowohl für die Eingabe als auch für die Ausgabe. Die Kosten variieren stark: Kleine Modelle kosten oft nur Bruchteile eines Cents pro Anfrage, während grosse Modelle wie GPT-4 oder Claude Opus deutlich teurer sind.

Bedeutung für Unternehmen

Für den Unternehmenseinsatz von Künstlicher Intelligenz ist die Inferenz der entscheidende Kostenfaktor im laufenden Betrieb. Während das Training einmalig hohe Kosten verursacht, fallen Inferenzkosten bei jeder einzelnen Nutzung an. Unternehmen sollten daher genau abwägen, welches Modell sie für welchen Anwendungsfall einsetzen: Nicht immer ist das größte Modell die beste Wahl, wenn ein kleineres, günstigeres Modell die Aufgabe ebenfalls zufriedenstellend löst.

Fazit

Inferenz ist der Moment, in dem KI ihren Wert beweist -- wenn gelerntes Wissen auf reale Probleme angewendet wird. Für Unternehmen lohnt es sich, die Balance zwischen Modellgröße, Geschwindigkeit und Kosten zu finden, um KI effizient und wirtschaftlich einzusetzen.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Inferenz: