Zum Inhalt springen

Essential

Der monatliche Mindestumsatz für Modelle im Tarif Essential beträgt: 1.000 €

Unsere Modelle

Standard-Modelle sind leistungsfähig und auf Geschwindigkeit ausgelegt – zuverlässig für die meisten Anwendungsfälle, ohne Kompromisse bei der Qualität. Premium-Modelle gehen darüber hinaus: für komplexes Reasoning, lange Kontexte und Aufgaben, bei denen die Ausgabequalität im Vordergrund steht.

Server Location
Cloud-Anbieter
Modell-Tier
Input-Preis
Output-Preis
Zeige 0 von 0 Modellen
Modell-Hosting Cloud-Anbieter Modell-Tier Anbieter Modellname Input Token Price
M Tokens
Output Token Price
M Tokens
Cached-Input-Token-Preis
M Tokens
Server Location RPM-Limit *
Anfragen/Min
TPM *
Tokens/Min
Context Window
Tokens
Links
* EU/EEA includes countries with an adequacy decision by the EU Commission. Weltweit (Worldwide) bedeutet, dass der Drittanbieter das Modell auf eigener Infrastruktur betreibt und Daten auch außerhalb der EU/EWR verarbeiten kann. Enterprise Trust † Aus dem Prefix-Cache bediente Prompt-Tokens werden mit 15 % des normalen Input-Token-Preises abgerechnet. Das gilt ausschließlich für T-Cloud-gehostete Modelle; für Modelle externer Anbieter wird die Preisgestaltung für Cached Tokens später ergänzt.

Servicehinweis zu den veröffentlichten RPM- und TPM-Werten

Abschnitt betitelt „Servicehinweis zu den veröffentlichten RPM- und TPM-Werten“

* Die oben gezeigten Werte für Anfragen pro Minute (RPM) und Token pro Minute (TPM) sind Best-Effort-/Best-Case-Obergrenzen im Shared LLM Serving Service. Sie geben den vertraglich maximal zulässigen Verbrauch an — keinen zugesicherten Durchsatz. Es gelten die folgenden Bedingungen:

  • Diese Werte sind nicht Teil des Service Level Agreements (SLA). Das SLA deckt ausschließlich die API-Verfügbarkeit ab; es erstreckt sich nicht auf Durchsatz, End-to-End-Latenz oder Time-to-First-Token.
  • Der tatsächlich erreichte Durchsatz, die End-to-End-Latenz und die Time-to-First-Token variieren mit der Plattformlast. Insbesondere können Open-Source-Modelle auf T-Cloud bei hoher gleichzeitiger Nachfrage unterhalb der veröffentlichten Obergrenzen arbeiten.
  • Kunden, die vertragliche Zusagen zu Durchsatz, End-to-End-Latenz oder Time-to-First-Token benötigen, sollten Dedicated LLM Serving in Betracht ziehen — dort lassen sich solche Zusagen als Performance-SLAs auf reservierter Hardware verhandeln.

Für individuelle Anforderungen wenden Sie sich an das AIFS-Team unter ai@t-systems.com.