Geschäft & Preis

Rate Limiting (API-Limits)

Rate Limits begrenzen, wie viele API-Anfragen ein Nutzer in einem bestimmten Zeitraum stellen darf. Typische Limits sind Requests per Minute (RPM) oder Tokens per Minute (TPM). Bei kostenloser Nutzung oder niedrigeren Preisplänen gelten strengere Limits. Bei geschäftlichem Einsatz ist es wichtig, die Rate Limits des gewählten KI-Tools zu kennen, um Unterbrechungen zu vermeiden.

Was ist Rate Limiting?

Rate Limiting bezeichnet die Begrenzung der Anzahl von Anfragen, die ein Nutzer oder eine Anwendung in einem bestimmten Zeitraum an eine API stellen darf. KI-Anbieter wie OpenAI, Anthropic oder Google setzen solche Limits ein, um ihre Infrastruktur vor Überlastung zu schützen, Missbrauch zu verhindern und die verfügbare Rechenleistung fair auf alle Kunden zu verteilen. Wer die Grenze überschreitet, erhält statt einer Antwort einen Fehler — typischerweise den HTTP-Statuscode 429 ("Too Many Requests").

Welche Arten von Limits gibt es?

Bei KI-APIs sind mehrere Messgrößen üblich, die parallel gelten:

  • RPM (Requests per Minute): Wie viele einzelne Anfragen pro Minute erlaubt sind
  • TPM (Tokens per Minute): Wie viele Tokens pro Minute verarbeitet werden dürfen — bei langen Dokumenten oft das entscheidende Limit
  • RPD/TPD (pro Tag): Tageskontingente, vor allem bei kostenlosen Zugängen
  • Gleichzeitige Anfragen (Concurrency): Wie viele Anfragen parallel laufen dürfen
  • Die Höhe der Limits hängt meist vom Preisplan ab: Kostenlose oder neue Accounts starten mit strengen Grenzen, mit steigender Nutzung und Zahlungshistorie werden die Stufen ("Tiers") automatisch oder auf Antrag erhöht. Enterprise-Kunden verhandeln oft individuelle Kontingente.

    Warum gibt es Rate Limits?

  • Infrastrukturschutz: GPU-Kapazität ist teuer und begrenzt — Lastspitzen einzelner Kunden dürfen nicht alle anderen ausbremsen
  • Missbrauchsprävention: Schutz vor Scraping, Spam-Generierung und Denial-of-Service-Angriffen
  • Kostenkontrolle: Auch für den Kunden selbst — Limits verhindern, dass fehlerhafte Skripte unbemerkt hohe Rechnungen erzeugen
  • Faire Verteilung: Alle Kunden erhalten planbare Leistung
  • Strategien für den Umgang mit Rate Limits

    Für den produktiven Einsatz von KI-APIs haben sich bewährte Muster etabliert:

  • Exponential Backoff: Bei einem 429-Fehler wartet die Anwendung kurz und versucht es mit wachsenden Abständen erneut
  • Request-Queueing: Anfragen werden in eine Warteschlange gestellt und gleichmäßig abgearbeitet
  • Batch-Verarbeitung: Nicht zeitkritische Aufgaben über Batch-APIs laufen lassen — oft mit eigenen, großzügigeren Limits und Rabatten
  • Caching: Wiederkehrende Anfragen zwischenspeichern statt erneut zu senden
  • Monitoring: Die von den Anbietern mitgelieferten Header (verbleibendes Kontingent, Reset-Zeitpunkt) auswerten

Bedeutung für Unternehmen

Wer KI-Funktionen in eigene Produkte einbaut, muss Rate Limits von Anfang an einplanen: Ein Kundenansturm oder eine Marketingkampagne kann sonst dazu führen, dass die KI-Funktion für alle Nutzer ausfällt. Vor der Anbieterwahl lohnt der Blick in die Limit-Dokumentation — insbesondere darauf, wie schnell sich Kontingente erhöhen lassen und ob es garantierte Kapazitäten (Provisioned Throughput) gibt. Für deutsche Unternehmen mit planbaren Workloads sind zudem Batch-APIs eine Möglichkeit, Kosten zu senken und Limits zu umgehen.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Rate Limiting (API-Limits):