Automatische Spracherkennung

Spracherkennung, die auf der CPU läuft.

8,9 gleichzeitige Streams pro vCPU bei einem RTF unter 1,05. Französisch mit 4,2 % WER. Über 40 Sprachen mit echter europäischer Tiefe. Keine GPU nötig – niemals.

Produktionsreif8,9 Streams/vCPURTF <1.054,2 % WER FranzösischNur CPU
Funktionen

Genauigkeit und Effizienz, gemessen und veröffentlicht.

8,9 Streams pro vCPU

Inferenz allein auf der CPU bei einem Echtzeitfaktor unter 1,05. Rund 3,5× die CPU-Dichte von Speechmatics, ohne GPU-Anforderung für Echtzeitbetrieb.

Französisch mit 4,2 % WER

Spitzengenauigkeit im Französischen, einschließlich regionaler Akzente, spontaner Sprache und Audio in Telefonqualität. Monatlich gebenchmarkt und öffentlich veröffentlicht.

First-Audio-Latenz unter 200 ms

Die Streaming-ASR zeigt Wörter, sobald sie erkannt werden, nicht erst am Ende der Äußerung. P95-First-Audio unter 200 ms im Produktionsverkehr.

Über 40 Sprachen, europäische Tiefe

Deutsch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Tschechisch, Ungarisch – Tendenz steigend. Jede Sprache ist produktionsreif und öffentlich gebenchmarkt.

Integration

Ein Endpunkt, drei Deployment-Modi.

curl https://api.voxist.com/v1/transcribe \
  -H "Authorization: Bearer $VOXIST_API_KEY" \
  -F audio=@call.wav \
  -F language=fr \
  -F diarize=true

Der Endpunkt /v1/transcribe unterstützt Streaming und Batch-Modus, mit Diarisierung, Zeitstempeln auf Wortebene und Konfidenzwerten. Verfügbar als europäisches SaaS, Private Cloud oder On-Premise.