Síntesis de voz neuronal

TTS neuronal diseñado en Europa.

Primer fragmento de audio en menos de 150 ms. Voces naturales en francés y más de 40 idiomas. Síntesis en streaming para productos en tiempo real. Alojado en la UE, sin exposición a la CLOUD Act estadounidense.

Calidad de producción en la UEPrimer fragmento <150 msVoces neuronalesAlojado en la UEClonación de voz disponible
Capacidades

Voces naturales, latencia real, datos en Europa.

Primer fragmento en menos de 150 ms

La síntesis de voz en streaming entrega el primer fragmento de audio en menos de 150 ms, lo que permite un ritmo conversacional natural para los productos en tiempo real.

Voces neuronales en más de 40 idiomas

Síntesis de voz de sonido natural con una prosodia adaptada a las lenguas europeas. Francés, alemán, español, italiano, portugués, neerlandés y más.

Clonación de voz disponible

Cree una voz neuronal personalizada a partir de tan solo 60 segundos de audio. Disponible en los contratos para empresas. Preservación de voz prevista en la hoja de ruta para finales de 2026.

Alojado en la UE, sin audio transatlántico

La síntesis se ejecuta íntegramente dentro de los centros de datos europeos (OVHcloud, Scaleway). Ningún audio sale de la UE. Conforme al RGPD por diseño.

Integración

Un único endpoint, streaming o por lotes.

curl https://api.voxist.com/v1/synthesize \
  -H "Authorization: Bearer $VOXIST_API_KEY" \
  -F text="Votre colis arrive demain." \
  -F voice=fr_neural_1 \
  -F format=wav

El endpoint /v1/synthesize admite salida en streaming y por lotes, con múltiples formatos de salida. Disponible como SaaS europeo, nube privada o instalación local.