Como funciona la pipeline de voz, por que una latencia extremo a extremo por debajo de uno o dos segundos es lo que la hace parecer humana, como disenar un flujo de llamada que gestione de verdad tus llamadas y que medir una vez que esta en marcha. Escrita para que entiendas el sistema antes de darnos un numero de telefono.
Automatizar las llamadas telefonicas significaba antes arboles IVR del tipo "pulse uno para facturacion" que los interlocutores detestaban. Eso ha cambiado. Un AI voice agent moderno mantiene una conversacion real y libre, consulta tu calendario, agenda la cita, responde preguntas desde tus datos reales y traspasa a una persona cuando la llamada lo requiere. La tecnologia esta lista. La parte dificil es disenarlo y desplegarlo bien, y eso es exactamente lo que esta guia cubre en detalle.
Cada llamada pasa por tres etapas en un ciclo estrecho. Entenderlas explica por que algunos agentes parecen naturales y otros parecen lentos.
Speech to text (STT). El interlocutor habla y un modelo de transcripcion rapido convierte el audio en texto, tipicamente en 200 a 400 milisegundos. La calidad de esta etapa importa mucho en entornos ruidosos, con acentos y con vocabulario especifico del sector. Un buen sistema usa un modelo optimizado para audio telefonico, no uno optimizado para grabacion en estudio silencioso.
Un modelo de lenguaje con herramientas. La transcripcion llega a un modelo de lenguaje que tiene acceso a un conjunto de herramientas: consultar disponibilidad en el calendario, recuperar una cuenta de cliente, reservar una cita, recuperar un precio. El modelo decide que herramientas usar y en que orden, luego compone una respuesta hablada. Aqui reside la inteligencia, y es tambien donde la latencia aumenta mas si el modelo o las llamadas a herramientas son lentas.
Text to speech (TTS). La respuesta del modelo se convierte de vuelta a audio y se transmite al interlocutor en streaming, de nuevo en unos pocos cientos de milisegundos. El TTS neuronal moderno con baja latencia suena natural. La voz se puede configurar en genero, acento, ritmo y calidez. No es la voz robotica y entrecortada de hace una decada.
El round trip a traves de las tres etapas, mas las llamadas a herramientas, es lo que los interlocutores perciben como el tiempo de respuesta del agente. Por debajo de un segundo, la conversacion parece natural. A dos segundos, los interlocutores notan una pausa pero la aceptan. Por encima de tres segundos, parece roto. Alcanzar ese objetivo de forma fiable es el principal reto de ingenieria, y es por eso que la infraestructura, la seleccion del modelo y el diseno de herramientas importan todos.
Abrimos cada colaboracion con un piloto gratuito, porque es la unica forma honesta de comprobar si el flujo de llamada funciona con tus llamadas reales. Esto es lo que ocurre:
Nos cuentas que llamadas quieres gestionar. Disenamos el flujo, configuramos la voz y la conectamos a un numero de prueba. En pocos dias puedes llamar a ese numero y escuchar al agente en accion. Grabamos la llamada y compartimos la transcripcion. Ves la resolucion, la latencia, el punto de transferencia. No te comprometes a nada hasta que lo hayas escuchado.
Tras el piloto, te quedas con la grabacion y el diseno del flujo de llamada tanto si sigues trabajando con nosotros como si no. Una llamada real en un flujo real es un artefacto util por si solo: pone fin a las conjeturas que matan la mayoria de los casos de negocio de voice AI antes de que empiecen.
El flujo de llamada es la logica que sigue el agente: que gestiona el solo, que le pregunta al interlocutor, cuando consulta datos y cuando transfiere. Hacerlo bien es la mayor parte del trabajo. Un flujo de llamada bien disenado con un modelo mediocre supera a un modelo brillante con un flujo mal disenado, siempre.
El diseno empieza con una pregunta: cuales son las llamadas que realmente entran? No las que crees que entran, sino las reales. Una semana de registros de llamadas reales casi siempre revela que un pequeno numero de tipos de llamada representa la mayoria del volumen. Esos son los primeros que vale la pena automatizar.
Para cada tipo de llamada definimos dos cosas: que gestiona el agente de principio a fin y que transfiere. La regla no es sobre complejidad, es sobre predictibilidad. Si el agente puede responder de forma fiable desde sus datos, gestiona. Si la respuesta podria ser incorrecta o las consecuencias son altas, transfiere. El interlocutor nunca llega a un callejon sin salida.
Un buen flujo de llamada tambien tiene recuperacion elegante integrada. Si el interlocutor dice algo inesperado, el agente lo reconoce y redirige en vez de repetir el mismo mensaje. Si el agente no puede resolver la llamada, ofrece transferir o tomar un mensaje. Siempre hay un camino a seguir.
Un agente que improvisa es peligroso. Si un interlocutor pregunta si hay disponibilidad el jueves a las tres de la tarde y el agente dice que si cuando el calendario esta lleno, tienes un problema. La solucion es el grounding: el agente recupera datos en tiempo real para cada respuesta que depende de ellos.
En la practica:
El grounding anade una pequena cantidad de latencia en cada turno donde se necesita una consulta, tipicamente entre 100 y 300 milisegundos. Casi siempre merece la pena. Un agente que nunca improvisa se gana la confianza del interlocutor y acumula fiabilidad con el tiempo.
La trampa de improvisar. Un modelo de lenguaje al que se le hace una pregunta sin datos producira a menudo una respuesta que suena plausible en vez de admitir incertidumbre. El grounding es la practica de ingenieria que previene esto en produccion. Disenamos el grounding en cada llamada a herramientas desde el inicio.
Las conversaciones telefonicas reales no siguen un patron rigido de hablas-tu-luego-hablo-yo. Los interlocutores interrumpen, confirman mientras el agente todavia esta hablando, o cambian de direccion a mitad de frase. Un voice agent que ignora esto suena robotico y frustrante. Uno bien construido lo gestiona de forma natural.
El barge-in es la capacidad de detectar que el interlocutor ha empezado a hablar mientras el agente todavia esta hablando, y detener el audio del agente de inmediato. Sin el, el agente acabara su frase por encima del interlocutor, lo que la mayoria de la gente considera maleducado. Con el, el agente se detiene, escucha y responde a lo que el interlocutor ha dicho realmente.
La deteccion de turno es mas sutil. El agente necesita saber cuando el interlocutor ha terminado de hablar, sin esperar demasiado (que parece poco receptivo) ni interrumpir demasiado pronto (que parece invasivo). El umbral correcto depende del contexto de la conversacion: un simple si o no obtiene un umbral de silencio corto; un interlocutor que procesa una respuesta compleja obtiene mas espacio. Un buen diseno de turn taking es uno de los detalles que separa a los agentes que parecen naturales de los que parecen una demo.
La gestion de fillers tambien importa. Cuando el agente esta procesando o llamando a una herramienta, puede producir un breve reconocimiento natural, "lo compruebo ahora mismo", en vez de quedarse en silencio. Medio segundo de silencio en una llamada telefonica parece mucho. Una frase de relleno lo cubre de forma natural y establece la expectativa correcta.
Cada flujo de llamada necesita un camino de traspaso a persona, y tiene que estar disenado para funcionar bien, no solo para existir. Una transferencia que deposita al interlocutor en una cola sin contexto es casi tan mala como no tener transferencia.
Cuando el agente decide transferir, hace dos cosas. Primero, le dice al interlocutor lo que esta ocurriendo y cuanto esperar aproximadamente: "Te estoy conectando con alguien del equipo ahora, estaran contigo en un momento." Segundo, pasa un paquete de contexto a la persona que descuelga: quien es el interlocutor, que pregunto, que hizo ya el agente y por que se produjo la transferencia.
Ese paquete de contexto significa que la persona descuelga ya informada. No le pide al interlocutor que repita su nombre o su problema. En un sistema bien construido, el contexto aparece en el panel del agente o se le dice a la persona como un susurro antes de que se conecte. De cualquier forma, la experiencia del interlocutor es continua, no fragmentada.
Las transferencias ocurren con reglas explicitas: el interlocutor pide hablar con una persona, el agente ha intentado dos veces sin resolucion, el tipo de llamada esta marcado como siempre-persona, o la confianza en una respuesta cae por debajo de un umbral. Estas reglas se definen en el flujo de llamada y se ajustan durante el piloto.
Un AI voice agent moderno puede operar en cualquier idioma con buena cobertura ASR y TTS. Hoy eso incluye todos los principales idiomas europeos (ingles, italiano, espanol, frances, aleman, portugues, neerlandes), los principales idiomas asiaticos (japones, mandarin, coreano) y muchos otros. Los despliegues multilingues son habituales cuando se atiende a interlocutores en mas de una region.
El agente puede detectar automaticamente el idioma del interlocutor y cambiar en mitad de la conversacion si es necesario. O se puede configurar para operar en un unico idioma en un numero especifico, con un numero separado para cada region. El diseno correcto depende de tu configuracion de enrutamiento de llamadas.
La seleccion de voz es parte de cada construccion. Elegimos entre una gama de voces neurales que encajan con tu marca en terminos de genero, acento y tono, y podemos configurar el ritmo y la calidez. Escuchas la voz en una llamada piloto antes de que nada salga en produccion. Si no encaja, la cambiamos. La voz no es definitiva.
El agente necesita un numero de telefono para atender, y ese numero tiene que conectarse a la pipeline de IA. Hay varias formas de hacerlo, y ninguna requiere sustituir el sistema telefonico existente.
Twilio. El camino de despliegue mas comun. Twilio proporciona un numero de telefono programable y un flujo de medios del que el agente lee y al que escribe. Gestiona la conexion PSTN para que no tengas que hacerlo tu. Provisionamos el numero, configuramos el flujo y lo conectamos al agente.
Trunks SIP. Si ya tienes un sistema VoIP o PBX, el agente puede colocarse delante a traves de un trunk SIP. Las llamadas llegan al trunk, el agente las gestiona y las transferencias vuelven a traves del trunk a tu equipo existente. Sin cambios de hardware, sin nuevo operador.
Portabilidad o redireccion de tu numero existente. No necesitas un numero nuevo. Puedes portar tu numero de negocio existente a una cuenta de Twilio, o apuntarlo al agente mediante desvio de llamadas en tu operador actual. Los interlocutores marcan el mismo numero de siempre. Solo que ahora llegan al agente en lugar de a una cola sin respuesta.
Para las empresas que gestionan cobertura fuera de horario, un diseno habitual es el desvio de llamadas condicional: las llamadas durante el horario laboral van a tu equipo, las llamadas fuera de horario se desvian al agente. Esto evita cualquier interrupcion en tu operacion en vivo mientras captura el volumen fuera de horario que antes se perdia.
| Via de telefonia | Cuando usarla | Que cambia en tu extremo |
|---|---|---|
| Numero provisionado por Twilio | Sin numero existente o empezando de cero en una linea dedicada | Nada; nosotros provisionamos y configuramos el numero |
| Trunk SIP a tu PBX | Tienes un sistema VoIP o PBX existente y quieres mantenerlo | Una credencial de trunk SIP; sin cambio de hardware |
| Portabilidad del numero | Quieres que los interlocutores lleguen al agente en tu numero de negocio existente | Solicitud de portabilidad a Twilio; tipicamente 2 a 4 semanas |
| Desvio de llamadas en el operador | Via mas rapida; mantener el numero en tu operador y desviarlo al agente | Una regla de desvio en tu operador actual; cambio el mismo dia |
| Desvio condicional | El agente cubre solo fuera de horario; el equipo atiende las llamadas en horario laboral | Una regla de desvio basada en horario en tu operador o PBX |
El valor de un voice agent crece cuando escribe el resultado de cada llamada en los sistemas que ya usas. Una llamada que termina sin registro es una llamada que podria haberse gestionado mejor. Una llamada que termina con un resumen estructurado en tu CRM es una llamada que mejora tus operaciones.
Lo que llega al CRM tras cada llamada:
La agenda en el calendario es una accion de primera clase en el flujo de llamada. El agente comprueba la disponibilidad a traves de la API de tu calendario, reserva el hueco mientras el interlocutor todavia esta en linea y envia una confirmacion. La reserva es real, en tiempo real. Sin retraso, sin paso manual entre la llamada y la cita que aparece en tu agenda.
Nos integramos con los sistemas CRM y de calendario que ya utilizas. Los mas habituales son Salesforce, HubSpot, Zoho CRM, Google Calendar, Calendly y cualquier sistema que exponga una API. La integracion es parte de la construccion, no un proyecto separado.
Los AI voice agents operan en un espacio regulado. Dos requisitos se aplican a casi todo despliegue, y varios otros se aplican segun la jurisdiccion y el sector.
Comunicacion de IA. En la mayoria de jurisdicciones, y ciertamente bajo las disposiciones de la AI Act de la UE que entraron en vigor en 2025, un sistema de IA que mantiene una conversacion de voz en tiempo real debe identificarse como tal. Lo integramos en el saludo de forma predeterminada. El agente dice su nombre, se identifica como IA e indica a quien representa. No es una cobertura de responsabilidad, es el diseno correcto: los interlocutores que saben que hablan con una IA cooperan mejor y se frustran menos cuando el agente tiene limitaciones.
Consentimiento de grabacion. Si la llamada se graba, los requisitos de consentimiento varian por region. En Estados Unidos, algunos estados requieren consentimiento de una parte y otros de dos partes. En la UE, el GDPR convierte el consentimiento explicito en el comportamiento seguro por defecto. Disenamos el saludo y el flujo de consentimiento para tus regiones operativas especificas, y documentamos la base juridica para la grabacion en el proyecto.
Otras areas de cumplimiento que vale la pena mencionar: la HIPAA se aplica si el agente gestiona informacion sanitaria en Estados Unidos y regula que se puede almacenar y donde. El PCI DSS se aplica si el agente recopila datos de tarjetas de pago por telefono, lo que generalmente significa disenar el flujo de llamada para evitarlo. Las normas especificas del sector en servicios financieros, legales y otros sectores regulados se anadien sobre estas. Evaluamos el cumplimiento con cuidado antes de cualquier despliegue en un contexto regulado.
Un voice agent sin medicion es un voice agent que no puedes mejorar. Estas son las cifras que importan, con objetivos honestos basados en despliegues reales:
| Metrica | Que indica | Rango objetivo realista |
|---|---|---|
| Tasa de contencion | Porcentaje de llamadas resueltas por el agente sin persona | Del 60% al 80% para tipos de llamada bien delimitados |
| Tasa de agenda | Porcentaje de llamadas en que la accion prevista (cita, lead, devolucion de llamada) se completo | Del 70% al 90% de las llamadas de agenda en scope |
| Tiempo medio de gestion | Duracion media de la llamada desde la atencion hasta la resolucion o transferencia | Entre 90 y 180 segundos para la mayoria de tipos de llamada rutinarios |
| Recuperacion de llamadas perdidas | Llamadas fuera de horario capturadas que de otro modo se habrian perdido | Cerca del 100% una vez en produccion, ya que el agente siempre responde |
| Tasa de transferencia | Porcentaje de llamadas transferidas a persona; tasa alta significa scope demasiado amplio o datos que faltan | Por debajo del 30% en un despliegue bien optimizado |
| Latencia P95 | Tiempo de respuesta round-trip en el percentil 95; los interlocutores lo perciben como naturalidad | Por debajo de 1.500 ms para una buena experiencia |
Estos objetivos son realistas, no aspiracionales. Un despliegue que empieza por debajo de ellos y esta bien instrumentado los alcanzara en pocas semanas de optimizacion. Uno sin medicion no mejorara en absoluto.
El piloto te proporciona numeros de base con tus llamadas reales antes de comprometerte con la construccion completa. Esa base es el fundamento mas honesto para proyectar el ROI, porque son datos reales de tus tipos de llamada reales, no un promedio del sector aplicado a una situacion que puede no encajar.
Los voice agents que dependen de sistemas externos heredan la fiabilidad de esos sistemas. Una API de calendario no disponible, un CRM lento, una llamada a una herramienta que agota el tiempo: cada uno de estos puede degradar o interrumpir la llamada si el agente no esta disenado para gestionarlos.
Un buen diseno de fallback se parece a esto: si una llamada a una herramienta falla, el agente lo reconoce en lenguaje natural y toma la siguiente mejor accion. Si el calendario no esta disponible, el agente toma la hora preferida del interlocutor y la anota para que una persona la confirme, en lugar de decirle al interlocutor que no puede ayudar. Si el CRM es lento, el agente procede con lo que sabe y pone en cola la escritura para cuando se recupere la conexion.
A nivel de infraestructura, desplegamos con proveedores de modelos redundantes y failover automatico en los pasos STT y TTS, para que una interrupcion del proveedor no saque al agente de linea. Los objetivos de tiempo de actividad para un despliegue en produccion deben estar en los noventas altos. Cualquier valor inferior es una senal de que el diseno de failover necesita trabajo.
La monitorizacion tambien importa. Cada componente de la pipeline debe emitir metricas de latencia y errores, y debe haber una alerta cuando la tasa de contencion baje inesperadamente o la latencia P95 tenga un pico. Estas senales detectan los problemas antes de que los interlocutores los noten.
La forma del trabajo es un piloto gratuito, luego una construccion de alcance fijo, luego operacion continua opcional. El piloto prueba el flujo de llamada con tus llamadas reales antes de que cambie dinero. La construccion lo integra en tu telefonia, CRM y calendario con monitorizacion y cumplimiento adecuados. La operacion significa que continuamos optimizando el agente a medida que cambia tu mix de llamadas, aniadiendo nuevos tipos de llamada y manteniendo las metricas de rendimiento en rango.
Este es uno de los servicios AI de Scalarly. El mismo enfoque de medir-primero y construir-un-flujo-real se aplica en todo el estudio. Si tus operaciones involucran grandes volumenes de documentos ademas de llamadas, puede que quieras echar un vistazo tambien a Document AI, que aplica el mismo motor al procesamiento de facturas, extraccion de contratos y digitalizacion certificada.
Ese es el motor completo. El siguiente paso es un piloto gratuito con tus llamadas propias: un flujo real, una voz real, una tasa de contencion medida antes de comprometerte a nada.
Un piloto gratuito del flujo de llamada con tus llamadas reales, la tasa de contencion medida, las reservas contadas. Despues salimos en vivo con tu numero.
Solicita el piloto gratuito