Spracherkennung, die auf der CPU läuft.
8,9 gleichzeitige Streams pro vCPU bei einem RTF unter 1,05. Französisch mit 4,2 % WER. Über 40 Sprachen mit echter europäischer Tiefe. Keine GPU nötig – niemals.
Genauigkeit und Effizienz, gemessen und veröffentlicht.
8,9 Streams pro vCPU
Inferenz allein auf der CPU bei einem Echtzeitfaktor unter 1,05. Rund 3,5× die CPU-Dichte von Speechmatics, ohne GPU-Anforderung für Echtzeitbetrieb.
Französisch mit 4,2 % WER
Spitzengenauigkeit im Französischen, einschließlich regionaler Akzente, spontaner Sprache und Audio in Telefonqualität. Monatlich gebenchmarkt und öffentlich veröffentlicht.
First-Audio-Latenz unter 200 ms
Die Streaming-ASR zeigt Wörter, sobald sie erkannt werden, nicht erst am Ende der Äußerung. P95-First-Audio unter 200 ms im Produktionsverkehr.
Über 40 Sprachen, europäische Tiefe
Deutsch, Spanisch, Italienisch, Portugiesisch, Niederländisch, Polnisch, Tschechisch, Ungarisch – Tendenz steigend. Jede Sprache ist produktionsreif und öffentlich gebenchmarkt.
Ein Endpunkt, drei Deployment-Modi.
curl https://api.voxist.com/v1/transcribe \
-H "Authorization: Bearer $VOXIST_API_KEY" \
-F audio=@call.wav \
-F language=fr \
-F diarize=trueDer Endpunkt /v1/transcribe unterstützt Streaming und Batch-Modus, mit Diarisierung, Zeitstempeln auf Wortebene und Konfidenzwerten. Verfügbar als europäisches SaaS, Private Cloud oder On-Premise.