Agent głosowy oparty na sztucznej inteligencji to nie tylko mikrofon z modelem językowym w tle. To cały łańcuch. Rejestruje mowę, analizuje prośbę, określa, do której części systemu należy, a następnie przekazuje ją do systemu, który może udzielić odpowiedzi lub podjąć działanie. Większość projektów głosowych zawodzi na ostatnim ogniwie, a nie na pierwszym. Część związana z mową działa, ale potem prośba nie ma gdzie trafić. Oto jak wygląda ten łańcuch od początku do końca oraz gdzie zapadają rzeczywiste decyzje.
Po co korzystać z funkcji głosowej, skoro istnieje już aplikacja?
Firmy usługowe zazwyczaj najpierw próbują skorzystać z oczywistych kanałów komunikacji. Najpierw linia telefoniczna, potem aplikacja, a czasem jedno i drugie. Poziom wykorzystania tych rozwiązań pozostaje niski, a ludzie przypisują to lenistwu lub kiepskiemu interfejsowi użytkownika. Rzadko jednak jest to cała prawda.
Linia telefoniczna wymaga od rozmówcy posługiwania się językiem, w którym może nie czuć się swobodnie. W rozmowie z nieznajomym. Być może po okresie oczekiwania. Aplikacja wymaga od użytkownika pobrania czegoś, założenia konta i zapoznania się z interfejsem, a to wszystko tylko po to, by zrealizować jedną prośbę. W obu przypadkach użytkownik musi włożyć wysiłek, zanim cokolwiek otrzyma w zamian. Rozpoznawanie głosu eliminuje ten wysiłek. Użytkownik mówi, czego chce, własnymi słowami, i coś się dzieje.
Tak właśnie wygląda sytuacja w przypadku konwersacyjnego agenta AI w środowisku usługowym. Nie chodzi o nowość, ale o krótszą drogę od intencji do rezultatu. Wyjaśnia to również, gdzie najlepiej sprawdzają się głosowi agenci AI w biznesie: w miejscach, gdzie prośba jest krótka, a osoba nie jest stałym użytkownikiem. Pokój hotelowy, poczekalnia w przychodni, piętro w obiekcie. Nikt nie wykształca nawyku korzystania z interfejsu, z którego korzysta tylko dwa razy.
Problem polega na tym, że komunikacja głosowa nie wybacza błędów. Przycisk albo działa, albo nie. Agent AI obsługujący komunikację głosową może cię słyszeć, rozumieć, a mimo to nie wykonać żadnej użytecznej czynności. Użytkownik nie ma pojęcia, która część systemu zawiodła. To nakłada odpowiedzialność na wszystkie elementy działające za mikrofonem.
Jak działa wirtualny asystent głosowy oparty na sztucznej inteligencji – krok po kroku
Cztery warstwy, w kolejności. Każda z nich może sama w sobie spowodować zatopienie produktu.
| Warstwa | Jak to działa | Co to psuje |
|---|---|---|
| Obudź i złap | Słowo aktywujące lub przycisk uruchamia sesję i rejestruje czysty dźwięk | Szum tła, mikrofony dalekiego zasięgu, fałszywe wyzwolenia |
| Rozpoznawanie mowy | Przekształca dźwięk w tekst, najlepiej w języku, w którym mówi osoba mówiąca | Akcenty, przełączanie się między językami, nieznane słownictwo z danej dziedziny |
| Klasyfikacja intencji | Przekształca tekst w sformułowane żądanie, które system może przekierować | Nakładające się intencje, prośby, które są dwiema rzeczami naraz |
| Realizacja zamówień | Odpowiedzi z bazy wiedzy lub wskazówki, do kogo się zwrócić | Nie ma za tym żadnego systemu rejestrującego, więc nic się nie dzieje |
Obudź i złap
Potrzebny jest celowy sygnał uruchamiający. Słowo aktywujące brzmi naturalnie, ale uruchamia się w sytuacjach, w których nie powinno. Fizyczny przycisk nigdy nie działa nieprawidłowo, ale musi znajdować się w zasięgu ręki. W praktyce potrzebne są oba rozwiązania, ponieważ różni ludzie sięgają po różne z nich.
Właśnie ta warstwa jest najbardziej narażona na zakłócenia z otoczenia. Pomieszczenie, w którym włączony jest telewizor, stwarza inne problemy akustyczne niż ciche biuro. Jest to przede wszystkim problem sprzętowy, a dopiero potem programowy.
Rozpoznawanie mowy
Dokładność nie sprowadza się tutaj do jednej liczby. Zależy ona od języka, akcentu oraz zakresu słownictwa dziedzinowego, które się wykorzystuje. U niektórych użytkowników rozpoznawanie będzie działało gorzej niż u innych. Projekt musi uwzględniać tę okoliczność, a nie ignorować ją.
Klasyfikacja intencji
To właśnie tutaj skupia się większość produktu. Nie próbujesz zrozumieć wszystkiego, co dana osoba może powiedzieć. Segregujesz to, co powiedziała, na niewielką liczbę typów, z którymi twój system potrafi sobie poradzić. Wąski zestaw intencji, z którymi radzisz sobie dobrze, jest lepszy niż szeroki zestaw, z którym radzisz sobie nierównomiernie.
Wszelkie elementy spoza zbioru wymagają rzetelnego rozwiązania awaryjnego. Jeśli nie wiesz odpowiedzi, zaproponuj, że przekażesz pytanie innej osobie, i nie zgaduj.
Realizacja zamówień
Prośba, która dotarła do odbiorcy, ale nie została zrealizowana, jest gorsza niż ta, której w ogóle nie zarejestrowano. Odbiorca uważa, że prośba dotarła. Prośby o informacje są rozpatrywane w oparciu o bazę wiedzy. Prośby o podjęcie działania trafiają do modułu routingu, który przekształca je w zgłoszenie z przypisanym wykonawcą i terminem odpowiedzi.
O tej kwestii pisaliśmy już w osobnym artykule. W jaki sposób zgłoszenia gości trafiają do odpowiedniego zespołu obejmuje klasyfikację, przydzielanie i eskalację, a ta sama struktura obowiązuje niezależnie od tego, czy zgłoszenie zostało przesłane głosowo, przez czat czy za pomocą formularza.
Opóźnienie łączy wszystkie cztery elementy
Czat tekstowy pozwala na przerwy. Rozmowa głosowa – nie. Jeśli wydłużysz przerwę między końcem zdania a początkiem odpowiedzi, ludzie będą się powtarzać, przerywać rozmówcy lub zakładać, że połączenie się zerwało. Od samego początku uwzględnij opóźnienia w całym łańcuchu komunikacyjnym. Nie da się tego naprawić po ustaleniu architektury.
Przykład z naszej praktyki: ButlerIQ
Butler, brytyjski startup, zwrócił się do nas z problemem, który łatwo opisać, ale trudno rozwiązać. Telefon w pokoju hotelowym był w praktyce bezużyteczny. Nie był zepsuty. Po prostu nikt z niego nie korzystał.
Gość nie sięgnie po telefon, by rozmawiać w obcym języku z nieznajomym. Nie chce czekać na linii. I nie zapyta po raz drugi, jeśli pierwsza próba nie przyniosła rezultatu. Trzy odrębne przeszkody, z których każda z osobna jest na tyle niewielka, że można ją zignorować, ale razem okazują się fatalne w skutkach.
To nie jest aplikacja, tylko urządzenie w pokoju
Rozwiązaniem nie była kolejna aplikacja. Stworzyliśmy fizyczne urządzenie głosowe przeznaczone do pokoju. Gość mówi “Hej, lokaju” lub naciska przycisk i mówi w swoim własnym języku. Nie trzeba niczego pobierać, zakładać konta ani się niczego uczyć. Nie ma nikogo po drugiej stronie, z kim można by czuć się niezręcznie.
Trzy rodzaje wniosków – celowo
Każde żądanie należy do jednej z trzech kategorii:
- Informacje — odpowiedzi zaczerpnięte bezpośrednio z bazy wiedzy hotelu: godzina wymeldowania, godziny serwowania śniadań, sposób działania klimatyzacji.
- Lokalne rekomendacje — restauracje, transport, co warto robić w okolicy.
- Działanie — wszystko, co wymaga udziału człowieka lub systemu: ręczniki, konserwacja, rezerwacja.
Trzy kategorie to celowe ograniczenie. Wystarczająco wąskie, by klasyfikacja pozostawała wiarygodna, a każda ścieżka była prawidłowo tworzona. Wystarczająco szerokie, by uwzględnić to, o co faktycznie pytają goście.
Wybór sprzętu był decyzją dotyczącą produktu
Firma Appricotsoft była odpowiedzialna za architekturę, sprzęt, stos rozwiązań AI oraz wdrożenie — w tym za wybór samych urządzeń. Ta ostatnia kwestia zasługuje na szczególną uwagę, ponieważ zespoły zazwyczaj traktują ją jako kwestię zaopatrzenia. A tak nie jest.
W przypadku produktu głosowego to właśnie to urządzenie określa, w jakiej odległości może stać osoba, by nadal być słyszaną. Określa ono, jak agent zachowuje się, gdy w tle włączony jest telewizor. Określa, jakie słowo aktywujące można realistycznie zastosować oraz co dzieje się z sygnałem audio, zanim opuści on pomieszczenie. Wybór tego urządzenia nakłada ograniczenia na wszystkie powyższe elementy. Jeśli wybierzesz sprzęt dopiero po zaprojektowaniu oprogramowania, w najgorszym możliwym momencie odkryjesz, że Twoje założenia dotyczące opóźnień i szumów były błędne.
Pełna wersja artykułu znajduje się w Studium przypadku dotyczące usługi ButlerIQ AI Concierge.
Ogólna lekcja: rozwiązanie głosowe zwyciężyło nie dlatego, że było nowocześniejsze, ale dlatego, że jednym ruchem wyeliminowało język, kolejkę i niezręczność. Jeśli kanał eliminuje tylko jeden z tych elementów, ten stary zazwyczaj się utrzymuje.
O czym należy pamiętać tuż przed wysyłką
Traktuj języki jako wymóg produktowy
Właśnie dzięki wielojęzyczności ten kanał w ogóle działa. Jeśli użytkownik nadal musi zmieniać język, by zostać zrozumianym, oznacza to, że przebudowałeś linię telefoniczną, dodając dodatkowe etapy. Obsługa języka ojczystego powinna być uwzględniona w architekturze już od pierwszego etapu projektowania. Przedstawiliśmy ten sam argument w odniesieniu do obsługa wielu języków w produktach hotelowych: nie mocuje się tego śrubami przed startem.
Test w rzeczywistym środowisku akustycznym
Ciche biuro to nie pokój hotelowy, recepcja kliniki ani hala produkcyjna. Hałas w tle, odległość od urządzenia oraz twarde powierzchnie – wszystko to wpływa na wyniki rozpoznawania. Sprawdź to podczas fazy pilotażowej, a nie dopiero po wdrożeniu.
Zaprojektuj rozwiązanie awaryjne przed scenariuszem idealnym
Każdy asystent głosowy natrafi na prośby, z którymi nie potrafi sobie poradzić. To, jak zareaguje w takiej sytuacji, decyduje o tym, czy użytkownicy do niego wrócą. Przyznanie się do błędu i zaproponowanie pomocy człowieka pozwala pozostać w grze. Natomiast pewne siebie podejmowanie niewłaściwych działań – nie.
Wcześnie ustal swoje stanowisko w sprawie prywatności
Urządzenie wyposażone w mikrofon w przestrzeni prywatnej rodzi uzasadnione pytanie. Kiedy ono nas podsłuchuje i jakie dane są przechowywane? Niezależnie od odpowiedzi, niech będzie to świadoma decyzja — taka, która wytrzyma kontrolę organu regulacyjnego i będzie jasna dla osoby przebywającej w pomieszczeniu.
Najpierw rozwałkuj ciasto na cienką warstwę
Jedno piętro, jedna lokalizacja, jeden dział. Agent głosowy generuje strumień rzeczywistych wypowiedzi użytkowników. Ten strumień stanowi najlepszą specyfikację tego, co należy stworzyć w następnej kolejności. Jeśli skalujesz system, zanim go przeanalizujesz, skalujesz niewłaściwy zestaw intencji.
Wybierz kanał zgodnie z własnym sumieniem
Linia telefoniczna pozwala na ponowne wykorzystanie sprzętu, ale utrzymuje bariery językowe i związane z kolejkami. Aplikacja zapewnia interfejs ekranowy, ale wymaga pobrania. Dedykowane urządzenie wiąże się z wyższymi kosztami początkowymi, ale eliminuje większość utrudnień. Sztuczna inteligencja pełniąca rolę recepcjonistki na linii telefonicznej oraz urządzenie głosowe w pomieszczeniu to różne produkty o różnych krzywych wdrażania. Wybierz rozwiązanie w oparciu o to, gdzie faktycznie występują utrudnienia dla Twoich użytkowników.
Wniosek
Sukces agenta głosowego opartego na sztucznej inteligencji zależy od tego, co dzieje się po wypowiedzeniu przez użytkownika. Rozpoznawanie mowy to problem w wystarczającym stopniu rozwiązany. Kluczowe znaczenie mają: klasyfikacja intencji na tyle wąska, by zapewnić niezawodność; baza wiedzy, na podstawie której warto udzielać odpowiedzi; silnik kierowania zapytań, który przekształca pozostałe sprawy w zgłoszenia przypisane konkretnym osobom; oraz sprzęt dostosowany do danego pomieszczenia.
Kanał ten zyskuje popularność, gdy pozwala pokonać jednocześnie więcej niż jedną przeszkodę: barierę językową, czas oczekiwania oraz skrępowanie związane z koniecznością ponownego zadawania pytania. Jeśli rozważasz wykorzystanie kanału głosowego, nasze Rozwiązania AI To podejście obejmuje jednocześnie architekturę, stos technologiczny oraz stronę urządzeń. To właśnie rozdzielenie tych elementów prowadzi do niepowodzeń w realizacji takich projektów.


