Riconoscimento automatico del parlato

Riconoscimento vocale che gira su CPU.

8,9 flussi simultanei per vCPU con un RTF inferiore a 1,05. Francese al 4,2 % di WER. Oltre 40 lingue con una vera profondità europea. Nessuna GPU richiesta, mai.

Pronto per la produzione8,9 flussi/vCPURTF <1.054,2 % WER franceseSolo CPU
Funzionalità

Precisione ed efficienza, misurate e pubblicate.

8,9 flussi per vCPU

Inferenza solo su CPU con un fattore di tempo reale inferiore a 1,05. Circa 3,5× la densità di CPU di Speechmatics, senza alcuna GPU per il lavoro in tempo reale.

Francese al 4,2 % di WER

Precisione ai massimi livelli sul francese, inclusi accenti regionali, parlato spontaneo e audio di qualità telefonica. Valutato ogni mese e pubblicato apertamente.

Latenza del primo audio inferiore a 200 ms

L'ASR in streaming mostra le parole man mano che vengono riconosciute, non alla fine dell'enunciato. P95 del primo audio sotto i 200 ms sul traffico di produzione.

Oltre 40 lingue, profondità europea

Tedesco, spagnolo, italiano, portoghese, olandese, polacco, ceco, ungherese e in continua crescita. Ogni lingua è pronta per la produzione e valutata apertamente.

Integrazione

Un endpoint, tre modalità di deployment.

curl https://api.voxist.com/v1/transcribe \
  -H "Authorization: Bearer $VOXIST_API_KEY" \
  -F audio=@call.wav \
  -F language=fr \
  -F diarize=true

L'endpoint /v1/transcribe supporta streaming e modalità batch, con diarizzazione, timestamp a livello di parola e punteggi di confidenza. Disponibile come SaaS europeo, cloud privato o on-premise.