Zum Inhalt springen

Audio (Speech-to-Text)

Dieser Inhalt ist für v1.1.0. Geh zur neuesten Version, um die aktuellste Dokumentation zu bekommen.

Dieser Inhalt ist noch nicht in deiner Sprache verfügbar.

Whisper-family models for transcription and translation. Available via the POST /audio/transcriptions and POST /audio/translations endpoints.

Anbieter
Cloud
Eingabe
Ausgabe
Streaming-Ausgabe
Tool Calling
Tarife
Zeige 5 von 5 Modellen
Token-für-Token-Ausgabe via Server-Sent Events. Geeignet für niedrige Latenz und Echtzeit-UI. Funktions-/Tool-Aufrufe (OpenAI-kompatibel). Das Modell kann strukturierte Tool-Aufrufe zurückgeben. Preis pro Million Prompt-Tokens, die aus dem Prefix-Cache bedient werden: 15 % des normalen Eingabepreises. Gilt nur für T-Cloud-gehostete Modelle — für externe Anbieter wird die Cache-Preisgestaltung später ergänzt.
Whisper Large v3 OpenAI OpenAI Gehostet auf T-Cloud Public — der souveränen Infrastruktur der Telekom in Deutschland. Audio Text 448 €14.61 €14.61 €2.1915 EssentialProfessionalAgentic
Whisper Large v3 Turbo OpenAI OpenAI Gehostet auf T-Cloud Public — der souveränen Infrastruktur der Telekom in Deutschland. Audio Text 448 €9.21 €9.21 €1.3815 EssentialProfessionalAgentic
Gemini 3 Flash Google Google Gehostet auf Google Cloud Platform (EU-Regionen). Text, Bild, Audio Text 1M €0.45 €2.70 n. v. EssentialProfessionalAgentic
Gemini 3 Pro (>200k) Google Google Gehostet auf Google Cloud Platform (EU-Regionen). Text, Bild, Audio Text 1M €3.60 €16.20 n. v. EssentialProfessionalAgentic
Gemini 3 Pro (≤200k) Google Google Gehostet auf Google Cloud Platform (EU-Regionen). Text, Bild, Audio Text 200K €1.80 €10.80 n. v. EssentialProfessionalAgentic