Reconnaissance automatique de la parole

Reconnaissance vocale sur CPU.

8,9 flux simultanés par vCPU avec un RTF inférieur à 1,05. Français à 4,2 % WER. Plus de 40 langues avec une profondeur européenne. Aucun GPU requis — jamais.

Certifié production8,9 flux/vCPURTF <1.054,2 % WER françaisCPU uniquement
Capacités

Précision et efficacité, mesurées et publiées.

8,9 flux par vCPU

Inférence sur CPU uniquement avec un facteur temps réel inférieur à 1,05. Environ 3,5× la densité CPU de Speechmatics, sans GPU requis pour un travail en temps réel.

Français à 4,2 % WER

Précision de pointe sur le français, incluant les accents régionaux, la parole spontanée et l'audio de qualité téléphonique. Référencé mensuellement et publié publiquement.

Latence première audio inférieure à 200 ms

L'ASR en streaming affiche les mots au fur et à mesure qu'ils sont reconnus, pas en fin d'énoncé. P95 première audio inférieur à 200 ms sur le trafic de production.

Plus de 40 langues, profondeur européenne

Allemand, espagnol, italien, portugais, néerlandais, polonais, tchèque, hongrois, et en croissance. Chaque langue est de qualité production et référencée publiquement.

Intégration

Un endpoint, trois modes de déploiement.

curl https://api.voxist.com/v1/transcribe \
  -H "Authorization: Bearer $VOXIST_API_KEY" \
  -F audio=@call.wav \
  -F language=fr \
  -F diarize=true

L'endpoint /v1/transcribe prend en charge le streaming et le traitement par lots, avec diarisation, horodatages au mot près et scores de confiance. Disponible en SaaS européen, cloud privé ou sur site.