IA de voz para atención al cliente escala con $24 millones: retos de latencia y autenticidad
Startups de modelos conversacionales buscan reemplazar sistemas IVR heredados, pero enfrentan limitaciones técnicas en automatización de llamadas comerciales
Las startups especializadas en inteligencia artificial de voz están experimentando un crecimiento notable al ofrecer soluciones para la gestión de llamadas en ventas, marketing y soporte al cliente. Las grandes organizaciones están evaluando externalizar sus servicios de atención telefónica a desarrolladores de modelos de voz y empresas de infraestructura dedicadas…

Las startups especializadas en inteligencia artificial de voz están experimentando un crecimiento notable al ofrecer soluciones para la gestión de llamadas en ventas, marketing y soporte al cliente. Las grandes organizaciones están evaluando externalizar sus servicios de atención telefónica a desarrolladores de modelos de voz y empresas de infraestructura dedicadas a esta tecnología, lo que representa un cambio significativo en la arquitectura de centros de contacto.
Una startup con sede en San Francisco acaba de cerrar una ronda de Serie A de $24 millones, liderada por M13 Ventures, con participación de Twilio Ventures, Corazon Capital y Unusual Ventures. La empresa, fundada en 2022 por investigadores de Stanford y un ingeniero exalumna de Amazon Alexa, ha construido un estudio de grabación propio para recopilar datos conversacionales, evitando depender de la extracción de audio de la web. Su diferencial técnico radica en una arquitectura basada en fonemas que permite adaptar pronunciaciones de marcas y términos específicos de industrias sin reentrenamiento de modelos por cliente.
Sin embargo, los líderes de la empresa reconocen un desafío crítico: la tecnología actual aún no logra igualar la efectividad de los sistemas heredados de respuesta de voz interactiva (IVR) para automatizar la mayoría de las llamadas comerciales. Aunque los modelos de lenguaje han facilitado crear aplicaciones de voz funcionales, la experiencia de interacción no ha cambiado significativamente. La startup está pivotando hacia modelos más eficientes de conversión de voz a voz —consolidando lo que antes eran tres componentes separados (voz a texto, texto a voz, modelo de lenguaje)— para reducir latencia, mejorar calidad de audio y abordar problemas como ruido de fondo.
La empresa cuenta con clientes en sectores como alimentos, atención médica, aerolíneas y tecnología financiera. Según reportes, los usuarios permanecen más tiempo en las llamadas gracias a la optimización de sus modelos, lo que ha permitido asegurar contratos con organizaciones de escala. Con la nueva financiación, la startup planea expandir su equipo de 35 personas, enfocándose en contratación de talento especializado en procesamiento de audio y modelos conversacionales.
Para los CTO, este movimiento del mercado plantea preguntas sobre arquitectura: ¿cuándo es preferible un modelo de voz a voz integrado versus componentes modulares? ¿Qué latencia es aceptable para diferentes tipos de llamadas (soporte versus ventas)? Para los CEO, el reto es evaluar cuándo la automatización de voz genera ROI versus mantener agentes humanos. La realidad actual sugiere que la IA de voz funciona mejor como herramienta de triage y escalamiento, no como reemplazo total de interacción humana en llamadas complejas.



