Antigraviti

Agenti AI telefonici: gli errori che vedo nelle PMI italiane

Valerii Yerokhin 10 min di lettura

Cornetta telefonica di marmo bianco che fluttua sopra un'onda sonora d'argento con un nodo verde muschio nel punto in cui si interrompe: gli agenti ai telefonici e il punto dove si rompono

Gli agenti AI telefonici rispondono bene alle domande semplici e si inceppano quando la richiesta esce dallo script previsto. La differenza tra un’installazione che funziona e una che genera lamentele è cosa succede nei tre secondi dopo che l’agente non ha capito.

Negli ultimi mesi ho seguito installazioni di agenti telefonici in diversi settori italiani (studi professionali, attività di servizi, realtà con centralino oberato nelle ore di punta) e gli errori che si ripetono sono sempre gli stessi tre o quattro, indipendentemente dal settore. Non sono errori di modello: sono errori di progettazione del flusso, quasi sempre evitabili con un test fatto bene prima di andare in produzione.

L’errore numero uno: nessuna via di fuga verso un umano

Il problema più comune non è che l’agente sbagli risposta. È che, quando non sa rispondere, continui a chiedere di ripetere la domanda con formulazioni diverse invece di passare la chiamata. Chi chiama un’azienda per un problema che non rientra nello script prova pazienza per una decina di secondi, poi comincia a dire “operatore” o “persona vera” a voce alta, e se l’agente non riconosce quella richiesta come segnale di escalation la chiamata finisce con il cliente che riattacca infastidito.

La correzione è progettuale, non tecnica: si definisce un numero massimo di tentativi di chiarimento (due, raramente tre) prima dell’escalation automatica, e si aggiungono parole trigger esplicite (“operatore”, “persona”, “umano”) che saltano subito la coda dei tentativi. Il contesto raccolto fino a quel momento (nome, motivo della chiamata, eventuali dati già forniti) va passato all’operatore insieme alla chiamata: fargli ripartire da zero vanifica tutto il vantaggio dell’agente.

Il secondo errore: la latenza che nessuno misura prima del lancio

La latenza tra la fine della frase del chiamante e l’inizio della risposta dell’agente è il dettaglio tecnico che decide se la conversazione sembra naturale o sembra un centralino automatico degli anni novanta. Sopra il secondo di silenzio, chi chiama comincia a chiedersi se la linea si è interrotta e ripete la domanda, sovrapponendosi alla risposta dell’agente che sta arrivando in quel momento: il risultato è una conversazione che si intreccia e confonde entrambe le parti.

Questo numero non si stima, si misura: prima di mettere in produzione un agente telefonico serve un giro di chiamate di test cronometrate, non una sensazione soggettiva di “sembra reattivo”. Il problema di latenza si nasconde spesso in due punti diversi dal modello stesso: il provider voce-testo che trascrive la chiamata in tempo reale, e il numero di passaggi (chiamate ad API esterne, verifiche su un gestionale) che il flusso fa prima di generare la risposta. Un flusso che consulta il calendario delle prenotazioni ad ogni turno di conversazione sarà sempre più lento di uno che lo consulta una volta e tiene il dato in memoria per il resto della chiamata.

Il terzo errore: il consenso alla registrazione trattato come un dettaglio

Chi installa un agente telefonico spesso copia il messaggio di benvenuto di un centralino tradizionale e si dimentica che sta trattando dati vocali con un sistema automatico, non solo registrando una chiamata. Il chiamante ha diritto a sapere, nei primi secondi, che sta parlando con un sistema automatizzato e che la conversazione può essere trattata per finalità di servizio. Non è un dettaglio da avvocati: è la differenza tra un’azienda che informa correttamente e una che rischia una segnalazione.

Il primo minuto di ogni agente telefonico che installo si gioca tutto sulla stessa domanda: se questa chiamata fosse difficile, dove va a finire? Se la risposta non è chiara prima del lancio, non lo sarà nemmeno durante la prima chiamata vera.

Quanto costa davvero un agente AI telefonico

Il prezzo reale si compone di tre voci che raramente vengono messe tutte sul tavolo insieme in fase di preventivo:

VoceCosa comprendeQuando pesa di più
Canale voceNumero telefonico, SIP trunk o provider di telefonia collegato all’agenteCosto fisso mensile, indipendente dal volume
Consumo per minutoTrascrizione vocale, modello linguistico, sintesi voce, per ogni minuto di conversazioneCresce con il volume di chiamate reali
Configurazione e testScrittura del flusso, script di escalation, giro di chiamate di test cronometrateConcentrato nel primo mese, poi quasi nullo

La voce che sorprende di più chi valuta per la prima volta questa tecnologia è la terza: un agente telefonico che non ha passato un giro serio di chiamate di test simulate (comprese quelle in cui si finge un chiamante confuso, uno che parla in dialetto stretto, uno che chiama da un ambiente rumoroso) arriva in produzione con difetti che si sarebbero visti in mezz’ora di prove.

Dove un agente telefonico funziona bene oggi

Non è tutto rischio: sulle chiamate a bassa complessità e alto volume ripetitivo, la differenza rispetto a un centralino tradizionale è misurabile. Orari di apertura, disponibilità generiche, indirizzo, conferma di un appuntamento già fissato: sono richieste che un agente gestisce senza mai stancarsi e senza tempi di attesa nelle ore di punta, quando il centralino umano è già occupato su altre linee. Le chiamate perse in sala nelle ore di servizio sono il caso dell’agente vocale per ristoranti di RistorantePRO.

Nei progetti che montiamo in produzione vedo tre verticali dove il filtro vocale paga subito:

  • Studi dentistici: l’agente conferma appuntamenti, richiama chi non risponde al promemoria e smista le urgenze al front office. Prima del lancio contiamo le chiamate perse nelle ore di poltrona; dopo due-quattro settimane lo stesso conteggio dice se il filtro ha ridotto i buchi in agenda.
  • Ristoranti e pizzerie: orari, menù del giorno, disponibilità tavolo nelle fasce ripetitive. La sala smette di rispondere al telefono alle 20:15 con le mani piene di piatti. I casi «tavolo da dodici» o «intolleranza complicata» restano umani.
  • Scuole di lingue: info su corsi, livelli, orari e prime richieste di prova. L’agente raccoglie nome, livello dichiarato e fascia oraria preferita e passa al segretario solo i lead caldi.

Lo stesso principio di filtro sulle richieste ripetitive vale per i flussi che descriviamo nella rubrica Automazioni che Funzionano: l’automazione buona non sostituisce il giudizio umano, lo libera dai casi dove non serve.

Il criterio con cui decido se una chiamata è adatta all’agente è sempre lo stesso: se la risposta corretta è già scritta da qualche parte (un orario, un listino, una disponibilità), l’agente la trova più in fretta di un operatore che deve controllare tre sistemi diversi. Se la risposta corretta richiede una valutazione (un prezzo su misura, un reclamo, un’eccezione alla regola), va all’umano, sempre.

Un parallelo utile è con gli agenti AI in generale: anche lì il criterio di successo non è “quanto è bravo l’agente a parlare”, ma quanto è chiaro il confine tra quello che gestisce da solo e quello che deve passare a una persona. Chi progetta il flusso senza definire quel confine prima del lancio lo scopre dal vivo, con un cliente reale al telefono, che è il momento peggiore per scoprirlo.

Il primo test da fare prima di lanciare l’agente

Prima di attivare un agente telefonico su un numero pubblico, un test minimo e concreto: farsi chiamare da tre persone diverse che non conoscono lo script, con tre richieste fuori dal previsto (una domanda ambigua, una richiesta di parlare con un umano detta a metà chiamata, una frase pronunciata con accento o inflessione dialettale). Se una delle tre chiamate finisce con la persona che riattacca senza risposta utile, il flusso non è pronto: si corregge il punto esatto dove si è rotto, non tutto il flusso da capo.

Questo test costa un’ora e si fa prima di spendere in configurazione avanzata: è la stessa logica di misura prima di aggiustare che vale per qualunque automazione, dal centralino telefonico a un flusso di email che raccontiamo altrove nella rivista.

Cosa dicono le linee guida sul trattamento vocale

Le indicazioni del Garante per la protezione dei dati personali sui sistemi automatizzati di gestione delle chiamate ricordano un principio semplice e spesso trascurato: informare il chiamante non basta se l’informazione arriva dopo che la conversazione è già iniziata, o se è nascosta in un messaggio troppo lungo che nessuno ascolta fino alla fine. Chi installa un agente telefonico farebbe bene a leggere le linee guida ufficiali del Garante Privacy prima di scrivere il messaggio di benvenuto, invece di copiare quello del centralino precedente.

Vale lo stesso principio che vediamo applicato bene o male in molte automazioni voce e testo delle PMI italiane: il consenso informato non è un timbro da apporre a posteriori, è parte del flusso fin dal primo secondo. Chi valuta oggi degli agenti AI telefonici per la propria attività dovrebbe partire da qui, non dalla scelta della voce sintetica: un agente ben progettato dice subito che è un sistema automatico, lo fa capire in una frase breve, e solo dopo passa alla domanda “come posso aiutarti”.

Domande frequenti

Un agente AI telefonico può sostituire completamente un centralinista?

Su un flusso di chiamate ripetitive e a bassa complessità (orari, prenotazioni semplici, informazioni sul listino) sì, con una via di fuga verso un umano per i casi fuori script. Su chiamate che richiedono trattativa o giudizio, no: l'agente resta un filtro, non un sostituto.

Quanto costa mettere in produzione un agente AI telefonico per una PMI?

Il costo si divide in tre voci: il numero e il canale voce (SIP trunk o provider telefonico), il consumo per minuto di conversazione del modello vocale, e il tempo di configurazione iniziale del flusso e degli script di escalation. Il primo mese pesa più dei successivi perché comprende i test.

Serve il consenso del chiamante per registrare la chiamata gestita dall'agente?

Sì. Vale la stessa regola delle chiamate con operatore umano: il chiamante va informato che la conversazione è registrata e trattata da un sistema automatico, di norma con un messaggio audio nei primi secondi della chiamata.

Cosa succede se l'agente non capisce la richiesta del cliente?

Se il flusso è progettato correttamente, dopo un numero limitato di tentativi di chiarimento l'agente passa la chiamata a un operatore umano con il contesto già raccolto, invece di continuare a chiedere di ripetere la stessa domanda.