PolyAI Dialog-RSN-1: de ce contează câteva sute de milisecunde într-un apel
Oamenii își răspund unii altora în 200-300 de milisecunde. Un agent care tace o secundă și jumătate sună a robot, oricât de bună ar fi vocea.
Echipa Vocalyy2 min de citit
Ce a lansat PolyAI
PolyAI, o companie britanică specializată în agenți vocali pentru relații cu clienții, a prezentat pe 30 iulie 2026 modelul Dialog-RSN-1. Noutatea e felul în care ascultă: modelul percepe direct sunetul și răspunde la el, fără să-l transforme mai întâi în text printr-un sistem separat de recunoaștere a vorbirii.
Potrivit companiei, modelul a fost construit pornind de la modele multimodale cu ponderi deschise, dezvoltate apoi prin antrenare suplimentară, și rulează pe configurații relativ mici, ceea ce ajută atât la viteză, cât și la cost.
Pauza dintre replici
Într-o conversație obișnuită, oamenii își răspund unii altora în aproximativ 200-300 de milisecunde. Nu observăm pauza, pentru că e naturală. O observăm doar când lipsește sau când e prea lungă.
280-500 ms
latența raportată de PolyAI pentru Dialog-RSN-1
PolyAI compară rezultatul cu un model mai vechi de la OpenAI, pentru care raportează între 860 și 1.900 de milisecunde. Comparația e a companiei, nu un test independent, dar ideea de fond e corectă: o pauză de peste o secundă e destul de lungă ca omul să creadă că apelul s-a blocat și să înceapă să vorbească din nou. Atunci vorbesc amândoi deodată, și conversația se strică.
De ce contează ca modelul să „audă” direct
Mulți agenți vocali funcționează ca o ștafetă: un sistem transcrie ce spune omul, altul decide răspunsul, al treilea îl rostește. Fiecare predare costă timp și pierde informație. În text nu se văd tonul, ezitarea sau faptul că omul a zis „nu, stați” la jumătatea frazei.
Un model care aude direct sunetul poate prinde tonul, ritmul, accentul și contextul din jur. PolyAI dă un exemplu simplu: un client care își spune numele și precizează cum se scrie. Tot ritmul vorbirii ajută modelul să știe când omul chiar a terminat de vorbit, deci să întrerupă mai rar.
Vocea, separată de „creier”
O alegere interesantă: la Dialog-RSN-1, partea care rostește răspunsul e separată de modelul care conduce conversația. Pentru o companie, asta înseamnă că vocea de brand poate fi ajustată independent, fără să se refacă tot sistemul.
Ce înseamnă pentru afacerea ta
Latența se testează cel mai simplu cu urechea. Sună agentul și fii atent la trei lucruri:
- 1Cât durează până răspunde după ce termini o întrebare.
- 2Dacă te lasă să termini fraza sau te întrerupe.
- 3Dacă se oprește imediat când începi tu să vorbești peste el.
Poți face testul chiar acum cu agentul nostru, de pe pagina principală. Dacă vrei să vezi cum pregătim un agent pentru apelurile tale, citește cum funcționează.
Surse
- 1.PolyAI launches new real-time voice conversation model to make AI-driven calls more humanSiliconANGLE, 30 iulie 2026
Articol scris de echipa Vocalyy pe baza surselor de mai sus. Cifrele și declarațiile le aparțin autorilor citați.