Reconocimiento automático del habla

Reconocimiento de voz que funciona en CPU.

8,9 flujos simultáneos por vCPU con un RTF inferior a 1,05. Francés con un 4,2 % de WER. Más de 40 idiomas con verdadera profundidad europea. Sin GPU, nunca.

Calidad de producción8,9 flujos/vCPURTF <1.054,2 % WER en francésSolo CPU
Capacidades

Precisión y eficiencia, medidas y publicadas.

8,9 flujos por vCPU

Inferencia solo en CPU con un factor de tiempo real inferior a 1,05. Cerca de 3,5× la densidad de CPU de Speechmatics, sin necesidad de GPU para trabajar en tiempo real.

Francés con un 4,2 % de WER

Precisión de primer nivel en francés, incluidos los acentos regionales, el habla espontánea y el audio de calidad telefónica. Evaluado cada mes y publicado abiertamente.

Latencia de primer audio inferior a 200 ms

El ASR en streaming muestra las palabras a medida que se reconocen, no al final del enunciado. P95 de primer audio por debajo de 200 ms en tráfico de producción.

Más de 40 idiomas, profundidad europea

Alemán, español, italiano, portugués, neerlandés, polaco, checo, húngaro y creciendo. Cada idioma es de calidad de producción y se evalúa abiertamente.

Integración

Un endpoint, tres modos de despliegue.

curl https://api.voxist.com/v1/transcribe \
  -H "Authorization: Bearer $VOXIST_API_KEY" \
  -F audio=@call.wav \
  -F language=fr \
  -F diarize=true

El endpoint /v1/transcribe admite streaming y procesamiento por lotes, con diarización, marcas de tiempo a nivel de palabra y puntuaciones de confianza. Disponible como SaaS europeo, nube privada o on-premise.