Come funziona la pipeline vocale, perche una latenza end-to-end inferiore a uno o due secondi e cio che la fa sembrare umana, come progettare un flusso di chiamata che gestisca davvero le tue chiamate e cosa misurare una volta che e live. Scritta perche tu capisca il sistema prima ancora di darci un numero di telefono.
Automatizzare le telefonate significava una volta alberi IVR "premi uno per la fatturazione" che i chiamanti detestavano. Questo e cambiato. Un AI voice agent moderno conduce una vera conversazione libera, controlla il tuo calendario, prenota l'appuntamento, risponde alle domande dai tuoi dati reali e passa la chiamata a una persona quando serve. La tecnologia e pronta. La parte difficile e progettarla e deployarla bene, ed e esattamente quello che questa guida copre nel dettaglio.
Ogni chiamata passa attraverso tre fasi in un ciclo stretto. Capirle spiega perche alcuni agenti sembrano naturali e altri sembrano lenti.
Speech to text (STT). Chi chiama parla e un modello di trascrizione veloce converte l'audio in testo, tipicamente entro 200 a 400 millisecondi. La qualita di questo passaggio conta molto in ambienti rumorosi, su parlato accentato e su vocabolario specifico di settore. Un buon sistema usa un modello ottimizzato per l'audio telefonico, non uno ottimizzato per la registrazione in studio silenzioso.
Un modello linguistico con strumenti. La trascrizione arriva in un modello linguistico che ha accesso a un insieme di strumenti: verifica la disponibilita nel calendario, recupera un account cliente, prenota un appuntamento, recupera un prezzo. Il modello decide quali strumenti chiamare e in quale ordine, poi compone una risposta parlata. Qui risiede l'intelligenza, ed e anche dove la latenza aumenta di piu se il modello o le chiamate agli strumenti sono lente.
Text to speech (TTS). La risposta del modello viene riconvertita in audio e trasmessa in streaming al chiamante, ancora entro poche centinaia di millisecondi. Il TTS neurale moderno a bassa latenza suona naturale. La voce puo essere configurata per genere, accento, ritmo e calore. Non e la voce robotica e tagliata di un decennio fa.
Il round trip attraverso tutte e tre le fasi, piu eventuali chiamate agli strumenti, e cio che i chiamanti percepiscono come tempo di risposta dell'agente. Sotto un secondo, la conversazione sembra naturale. A due secondi, i chiamanti notano una pausa ma la accettano. Oltre i tre secondi, sembra rotto. Raggiungere quell'obiettivo in modo affidabile e la principale sfida ingegneristica, ed e per questo che infrastruttura, selezione del modello e design degli strumenti contano tutti.
Apriamo ogni ingaggio con un pilot gratuito, perche e l'unico modo onesto per testare se il flusso di chiamata funziona sulle tue chiamate reali. Ecco cosa succede:
Ci dici quali chiamate vuoi gestire. Progettiamo il flusso, configuriamo la voce e la colleghiamo a un numero di test. Nel giro di pochi giorni puoi chiamare quel numero e sentire l'agente in azione. Registriamo la chiamata e condividiamo la trascrizione. Vedi la risoluzione, la latenza, il punto di trasferimento. Non ti impegni a nulla finche non l'hai ascoltata.
Dopo il pilot, tieni la registrazione e il design del flusso di chiamata che tu continui o meno a lavorare con noi. Una chiamata reale su un flusso reale e un artefatto utile di per se: mette fine all'indovinare che uccide la maggior parte dei casi di business di voice AI prima ancora che inizino.
Il flusso di chiamata e la logica che l'agente segue: cosa gestisce da solo, cosa chiede al chiamante, quando consulta una fonte di dati e quando trasferisce. Farlo bene e la maggior parte del lavoro. Un flusso di chiamata ben progettato con un modello mediocre supera un modello brillante su un flusso mal progettato, ogni volta.
Il design inizia con una domanda: quali sono le chiamate che arrivano davvero? Non quelle che pensi di ricevere, ma quelle reali. Una settimana di log di chiamate reali rivela quasi sempre che un piccolo numero di tipi di chiamata copre la maggioranza del volume. Quelli sono i primi da automatizzare.
Per ogni tipo di chiamata definiamo due cose: cosa l'agente gestisce dall'inizio alla fine e cosa trasferisce. La regola non riguarda la complessita, riguarda la prevedibilita. Se l'agente puo rispondere in modo affidabile dai suoi dati, gestisce. Se la risposta potrebbe essere sbagliata o la posta in gioco e alta, trasferisce. Chi chiama non arriva mai a un vicolo cieco.
Un buon flusso di chiamata ha anche un recupero elegante integrato. Se il chiamante dice qualcosa di inatteso, l'agente lo riconosce e reindirizza piuttosto che ripetere lo stesso prompt. Se l'agente non riesce a risolvere la chiamata, offre di trasferire o di prendere un messaggio. C'e sempre una via d'uscita.
Un agente che indovina e pericoloso. Se un chiamante chiede se uno slot e disponibile giovedi alle tre del pomeriggio e l'agente dice si quando il calendario e pieno, hai un problema. La soluzione e il grounding: l'agente recupera dati live per ogni risposta che dipende da essi.
In pratica:
Il grounding aggiunge una piccola quantita di latenza a ogni turno in cui e necessaria una ricerca, tipicamente da 100 a 300 millisecondi. Ne vale quasi sempre la pena. Un agente che non indovina mai guadagna la fiducia del chiamante e accumula affidabilita nel tempo.
La trappola dell'indovinare. Un modello linguistico interrogato su qualcosa per cui non ha dati produrra spesso una risposta plausibile invece di ammettere incertezza. Il grounding e la pratica ingegneristica che previene questo in produzione. Progettiamo il grounding in ogni chiamata agli strumenti fin dall'inizio.
Le vere conversazioni telefoniche non seguono un pattern rigido parla-tu-poi-parlo-io. Chi chiama interrompe, conferma mentre l'agente sta ancora parlando, o cambia direzione a meta frase. Un voice agent che ignora questo suona robotico e frustrante. Uno ben costruito lo gestisce in modo naturale.
Il barge-in e la capacita di rilevare che il chiamante ha iniziato a parlare mentre l'agente sta ancora parlando, e di fermare immediatamente l'audio dell'agente. Senza di esso, l'agente finira la sua frase sopra il chiamante, il che la maggior parte delle persone trova maleducato. Con esso, l'agente si ferma, ascolta e risponde a cio che il chiamante ha effettivamente detto.
Il rilevamento del turn taking e piu sottile. L'agente deve sapere quando il chiamante ha finito di parlare, senza aspettare troppo (che sembra non reattivo) o interrompere troppo presto (che sembra invadente). La soglia giusta dipende dal contesto della conversazione: un semplice si o no ottiene una soglia di silenzio breve; un chiamante che elabora una risposta complessa ottiene piu spazio. Un buon design del turn taking e uno dei dettagli che separa gli agenti che sembrano naturali da quelli che sembrano una demo.
Anche la gestione dei filler conta. Quando l'agente sta elaborando o chiamando uno strumento, puo produrre un breve riconoscimento naturale, "controllo subito per te", invece di stare in silenzio. Mezzo secondo di silenzio in una telefonata sembra lungo. Una frase filler lo riempie naturalmente e stabilisce l'aspettativa giusta.
Ogni flusso di chiamata ha bisogno di un percorso di passaggio a un operatore, e deve essere progettato per funzionare bene, non solo per esistere. Un trasferimento che butta il chiamante in una coda senza contesto e quasi brutto quanto nessun trasferimento.
Quando l'agente decide di trasferire, fa due cose. Prima dice al chiamante cosa sta succedendo e quanto aspettarsi di attendere: "Ti sto collegando con qualcuno del team, sara con te tra un momento." Poi passa un pacchetto di contesto all'operatore che risponde: chi e il chiamante, cosa ha chiesto, cosa ha gia fatto l'agente e perche e avvenuto il trasferimento.
Quel pacchetto di contesto significa che l'operatore risponde gia informato. Non chiede al chiamante di ripetere il nome o il problema. In un sistema ben costruito, il contesto appare nel dashboard dell'agente o viene detto all'operatore come whisper prima che si colleghi. In entrambi i casi, l'esperienza del chiamante e continua, non frammentata.
I trasferimenti avvengono su regole esplicite: il chiamante chiede di parlare con una persona, l'agente ha tentato due volte senza risoluzione, il tipo di chiamata e contrassegnato come sempre-umano, o la confidenza in una risposta scende sotto una soglia. Queste regole sono definite nel flusso di chiamata e ottimizzate durante il pilot.
Un AI voice agent moderno puo operare in qualsiasi lingua con buona copertura ASR e TTS. Oggi include tutte le principali lingue europee (inglese, italiano, spagnolo, francese, tedesco, portoghese, olandese), le principali lingue asiatiche (giapponese, mandarino, coreano) e molte altre. I deployment multilingua sono comuni quando si servono chiamanti in piu di una regione.
L'agente puo rilevare automaticamente la lingua del chiamante e cambiare nel mezzo della conversazione se necessario. Oppure puo essere configurato per operare in una singola lingua su un numero specifico, con un numero separato per ogni regione. Il design corretto dipende dalla tua configurazione di routing delle chiamate.
La selezione della voce fa parte di ogni build. Scegliamo tra una gamma di voci neurali che si adattano al tuo brand in termini di genere, accento e tono, e possiamo configurare ritmo e calore. Ascolti la voce su una chiamata pilota prima che nulla vada live. Se non si adatta, la cambiamo. La voce non e definitiva.
L'agente ha bisogno di un numero di telefono a cui rispondere, e quel numero deve connettersi alla pipeline AI. Ci sono diversi modi per farlo, e nessuno richiede di sostituire il sistema telefonico esistente.
Twilio. Il percorso di deployment piu comune. Twilio fornisce un numero di telefono programmabile e un flusso multimediale da cui l'agente legge e su cui scrive. Gestisce la connessione PSTN cosi non devi farlo tu. Provisioniamo il numero, configuriamo il flusso e lo colleghiamo all'agente.
SIP trunk. Se hai gia un sistema VoIP o PBX, l'agente puo posizionarsi davanti tramite un SIP trunk. Le chiamate arrivano al trunk, l'agente le gestisce e i trasferimenti tornano attraverso il trunk al tuo team esistente. Nessun cambiamento hardware, nessun nuovo operatore richiesto.
Portabilita o reindirizzamento del numero esistente. Non hai bisogno di un nuovo numero. Puoi portare il tuo numero aziendale esistente su un account Twilio, o puntarlo all'agente tramite inoltro di chiamata al tuo operatore attuale. I chiamanti compongono lo stesso numero di sempre. Raggiungono semplicemente l'agente invece di una coda senza risposta.
Per le aziende che gestiscono la copertura fuori orario, un design comune e l'inoltro di chiamata condizionale: le chiamate durante l'orario di lavoro vanno al tuo team, le chiamate fuori orario vengono inoltrate all'agente. Questo evita qualsiasi interruzione all'operativita live mentre cattura il volume fuori orario che in precedenza andava perso.
| Percorso telefonico | Quando usarlo | Cosa cambia dalla tua parte |
|---|---|---|
| Numero provisionato su Twilio | Nessun numero esistente o si inizia da zero su una linea dedicata | Niente; provisioniamo e configuriamo noi il numero |
| SIP trunk al tuo PBX | Hai un sistema VoIP o PBX esistente e vuoi mantenerlo | Una credenziale SIP trunk; nessun cambiamento hardware |
| Portabilita del numero | Vuoi che i chiamanti raggiungano l'agente sul tuo numero aziendale esistente | Richiesta di portabilita a Twilio; tipicamente da 2 a 4 settimane |
| Inoltro di chiamata all'operatore | Percorso piu rapido; mantieni il numero al tuo operatore e lo inoltri all'agente | Una regola di inoltro al tuo operatore attuale; cambiamento in giornata |
| Inoltro condizionale | L'agente copre solo fuori orario; il team prende le chiamate durante l'orario di lavoro | Una regola di inoltro basata su orario al tuo operatore o PBX |
Il valore di un voice agent cresce quando scrive il risultato di ogni chiamata nei sistemi che gia utilizzi. Una chiamata che termina senza registro e una chiamata che si sarebbe potuta gestire meglio. Una chiamata che termina con un riepilogo strutturato nel tuo CRM e una chiamata che migliora le tue operazioni.
Cosa arriva nel CRM dopo ogni chiamata:
La prenotazione nel calendario e un'azione di prima classe nel flusso di chiamata. L'agente controlla la disponibilita tramite la tua API di calendario, prenota lo slot mentre il chiamante e ancora in linea e invia una conferma. La prenotazione e reale, in tempo reale. Non c'e ritardo, nessun passaggio manuale tra la chiamata e l'appuntamento che compare nel tuo programma.
Ci integriamo con i sistemi CRM e calendario che gia utilizzi. I piu comuni sono Salesforce, HubSpot, Zoho CRM, Google Calendar, Calendly e qualsiasi sistema che espone una API. L'integrazione fa parte della build, non e un progetto separato.
Gli AI voice agent operano in uno spazio regolamentato. Due requisiti si applicano a quasi ogni deployment, e diversi altri si applicano a seconda della giurisdizione e del settore.
Comunicazione AI. Nella maggior parte delle giurisdizioni, e certamente ai sensi delle disposizioni dell'AI Act UE entrate in vigore nel 2025, un sistema AI che conduce una conversazione vocale in tempo reale deve identificarsi come tale. Lo integriamo nel saluto per impostazione predefinita. L'agente dice il suo nome, si identifica come AI e indica chi rappresenta. Non e una copertura di responsabilita, e il design corretto: i chiamanti che sanno di parlare con una AI collaborano meglio e sono meno frustrati quando l'agente ha dei limiti.
Consenso alla registrazione. Se la chiamata viene registrata, i requisiti di consenso variano per regione. Negli Stati Uniti, alcuni stati richiedono il consenso di una parte e altri di entrambe le parti. Nell'UE, il GDPR rende il consenso esplicito il default sicuro. Progettiamo il saluto e il flusso di consenso per le tue specifiche regioni operative, e documentiamo la base giuridica per la registrazione nell'ingaggio.
Altre aree di conformita da citare: l'HIPAA si applica se l'agente gestisce informazioni sanitarie negli Stati Uniti e disciplina cosa puo essere archiviato e dove. Il PCI DSS si applica se l'agente raccoglie dati di carte di pagamento al telefono, il che in genere significa progettare il flusso di chiamata per evitarlo. Le norme specifiche di settore nei servizi finanziari, legali e altri settori regolamentati si aggiungono a queste. Valutiamo la conformita con attenzione prima di qualsiasi deployment in un contesto regolamentato.
Un voice agent senza misurazione e un voice agent che non puoi migliorare. Questi sono i numeri che contano, con obiettivi onesti basati su deployment reali:
| Metrica | Cosa indica | Range obiettivo realistico |
|---|---|---|
| Tasso di contenimento | Quota di chiamate risolte dall'agente senza un operatore | Dal 60% all'80% per tipi di chiamata ben delimitati |
| Tasso di prenotazione | Quota di chiamate in cui l'azione prevista (appuntamento, lead, richiamata) e stata completata | Dal 70% al 90% delle chiamate di prenotazione in scope |
| Tempo medio di gestione | Durata media della chiamata dalla risposta alla risoluzione o al trasferimento | Da 90 a 180 secondi per la maggior parte dei tipi di chiamata di routine |
| Recupero chiamate perse | Chiamate fuori orario acquisite che altrimenti sarebbero andate perse | Vicino al 100% una volta live, poiche l'agente risponde sempre |
| Tasso di trasferimento | Quota di chiamate trasferite a un operatore; un tasso alto significa scope troppo ampio o dati mancanti | Sotto il 30% per un deployment ben ottimizzato |
| Latenza P95 | Tempo di risposta round-trip al 95esimo percentile; i chiamanti lo percepiscono come naturalezza | Sotto 1.500 ms per una buona esperienza |
Questi obiettivi sono realistici, non aspirazionali. Un deployment che inizia sotto di essi e ben strumentato li raggiungerebbe nel giro di poche settimane di ottimizzazione. Un deployment senza misurazione non migliorera affatto.
Il pilot ti fornisce numeri di base sulle tue chiamate reali prima che tu ti impegni nella build completa. Quella base e il fondamento piu onesto per proiettare il ROI, perche si tratta di dati reali dai tuoi tipi di chiamata reali, non di una media di settore applicata a una situazione che potrebbe non adattarsi.
I voice agent che dipendono da sistemi esterni ereditano l'affidabilita di quei sistemi. Una API del calendario non disponibile, un CRM lento, una chiamata a uno strumento che va in timeout: ognuno di questi puo degradare o interrompere la chiamata se l'agente non e progettato per gestirli.
Un buon design di fallback funziona cosi: se una chiamata a uno strumento fallisce, l'agente lo riconosce in linguaggio naturale e prende la prossima azione migliore. Se il calendario non e disponibile, l'agente prende l'orario preferito del chiamante e lo annota perche un operatore lo confermi, invece di dire al chiamante che non puo aiutare. Se il CRM e lento, l'agente procede con cio che sa e mette in coda la scrittura per quando la connessione si ripristina.
A livello di infrastruttura, deployiamo con provider di modelli ridondanti e failover automatico sui passi STT e TTS, cosi un'interruzione del provider non mette offline l'agente. Gli obiettivi di uptime per un deployment in produzione dovrebbero essere nei novanta alti. Qualsiasi valore inferiore e un segnale che il design di failover richiede lavoro.
Anche il monitoraggio e importante. Ogni componente della pipeline dovrebbe emettere metriche di latenza ed errore, e dovrebbe esserci un alert quando il tasso di contenimento scende inaspettatamente o la latenza P95 registra un picco. Questi segnali intercettano i problemi prima che i chiamanti li notino.
La forma del lavoro e un pilot gratuito, poi una build a scope fisso, poi operativita continuativa opzionale. Il pilot testa il flusso di chiamata sulle tue chiamate reali prima che venga scambiato denaro. La build lo integra nella tua telefonia, CRM e calendario con monitoraggio e conformita adeguati. L'operativita significa che continuiamo a ottimizzare l'agente man mano che il tuo mix di chiamate cambia, aggiungendo nuovi tipi di chiamata e mantenendo le metriche di performance in range.
Questo e uno dei servizi AI di Scalarly. Lo stesso approccio misura-prima, costruisci-un-workflow-reale si applica in tutto lo studio. Se le tue operazioni coinvolgono grandi volumi di documenti oltre alle chiamate, potresti voler guardare anche Document AI, che applica lo stesso motore all'elaborazione fatture, estrazione da contratti e digitalizzazione certificata.
Questo e il motore completo. Il prossimo passo e un pilot gratuito sulle tue chiamate: un flusso reale, una voce reale, un tasso di contenimento misurato prima che tu ti impegni a qualsiasi cosa.
Un pilot gratuito del flusso di chiamata sulle tue chiamate reali, il tasso di contenimento misurato, le prenotazioni contate. Poi andiamo live sul tuo numero.
Richiedi il pilot gratuito