Reconnaissance vocale sur CPU.
8,9 flux simultanés par vCPU avec un RTF inférieur à 1,05. Français à 4,2 % WER. Plus de 40 langues avec une profondeur européenne. Aucun GPU requis — jamais.
Précision et efficacité, mesurées et publiées.
8,9 flux par vCPU
Inférence sur CPU uniquement avec un facteur temps réel inférieur à 1,05. Environ 3,5× la densité CPU de Speechmatics, sans GPU requis pour un travail en temps réel.
Français à 4,2 % WER
Précision de pointe sur le français, incluant les accents régionaux, la parole spontanée et l'audio de qualité téléphonique. Référencé mensuellement et publié publiquement.
Latence première audio inférieure à 200 ms
L'ASR en streaming affiche les mots au fur et à mesure qu'ils sont reconnus, pas en fin d'énoncé. P95 première audio inférieur à 200 ms sur le trafic de production.
Plus de 40 langues, profondeur européenne
Allemand, espagnol, italien, portugais, néerlandais, polonais, tchèque, hongrois, et en croissance. Chaque langue est de qualité production et référencée publiquement.
Un endpoint, trois modes de déploiement.
curl https://api.voxist.com/v1/transcribe \
-H "Authorization: Bearer $VOXIST_API_KEY" \
-F audio=@call.wav \
-F language=fr \
-F diarize=trueL'endpoint /v1/transcribe prend en charge le streaming et le traitement par lots, avec diarisation, horodatages au mot près et scores de confiance. Disponible en SaaS européen, cloud privé ou sur site.