Reconocimiento de voz que funciona en CPU.
8,9 flujos simultáneos por vCPU con un RTF inferior a 1,05. Francés con un 4,2 % de WER. Más de 40 idiomas con verdadera profundidad europea. Sin GPU, nunca.
Precisión y eficiencia, medidas y publicadas.
8,9 flujos por vCPU
Inferencia solo en CPU con un factor de tiempo real inferior a 1,05. Cerca de 3,5× la densidad de CPU de Speechmatics, sin necesidad de GPU para trabajar en tiempo real.
Francés con un 4,2 % de WER
Precisión de primer nivel en francés, incluidos los acentos regionales, el habla espontánea y el audio de calidad telefónica. Evaluado cada mes y publicado abiertamente.
Latencia de primer audio inferior a 200 ms
El ASR en streaming muestra las palabras a medida que se reconocen, no al final del enunciado. P95 de primer audio por debajo de 200 ms en tráfico de producción.
Más de 40 idiomas, profundidad europea
Alemán, español, italiano, portugués, neerlandés, polaco, checo, húngaro y creciendo. Cada idioma es de calidad de producción y se evalúa abiertamente.
Un endpoint, tres modos de despliegue.
curl https://api.voxist.com/v1/transcribe \
-H "Authorization: Bearer $VOXIST_API_KEY" \
-F audio=@call.wav \
-F language=fr \
-F diarize=trueEl endpoint /v1/transcribe admite streaming y procesamiento por lotes, con diarización, marcas de tiempo a nivel de palabra y puntuaciones de confianza. Disponible como SaaS europeo, nube privada o on-premise.