Po rozmowie z klientem powstaje lista ustaleń z terminami i linkami do odpowiednich fragmentów nagrania.
System zapisuje rozmowę w tekście, rozpoznaje rozmówców i wskazuje ustalenia. Przy każdym z nich podaje osobę odpowiedzialną, termin i moment nagrania. Skargi, płatności oraz niejasne terminy zawsze trafiają do pracownika.
Co zmierzyliśmy
Wersja demonstracyjna nie zawiera danych, nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.
- Dwa zapisane pomiary
- Co zmierzyliśmy
- 9/9 kontroli strukturalnych · 12/12 transkrypcji przez usługę zewnętrzną
- Ustalenia z rozmów telefonicznych
- Zweryfikowano
- korpus syntetyczny
Problem, rozwiązanie i wynik
Problem
Ważne ustalenia z rozmów pozostają w nagraniu lub w pamięci pracownika. Gdy klient wraca po kilku tygodniach, zespół traci czas na odsłuch i może nie wiedzieć, kto obiecał dalsze działanie.
Jak to działa
System tworzy transkrypcję z podziałem na mówców i łączy każde ustalenie z dokładnym momentem nagrania. Następnie przygotowuje listę działań i szkic odpowiedzi. Człowiek zatwierdza każdą odpowiedź głosową przed jej utworzeniem.
Co sprawdziliśmy na 12 rozmowach
Wersja demonstracyjna nie zawiera danych, nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.
Dla kogo
Ten system ma sens, jeśli po rozmowach zostają krótkie notatki bez terminów, ważne ustalenia trudno później odnaleźć, a każda odpowiedź głosowa musi mieć zatwierdzenie konkretnej osoby.
Nagranie → ustalenia → zwolnienie → głos
- 01Każde ustalenie wskazuje właściciela, termin i sekundę w nagraniu
- 02Rozmowa wstrzymana do przeglądu nie dochodzi do dostawcy syntezy
- 03Audio powstaje dopiero po zapisanym zwolnieniu przez człowieka
- Typ firmy
- Firmy usługowe z nagrywanymi rozmowami klienta lub serwisu
- Wejście
- Nagrania rozmów telefonicznych; wersja demonstracyjna wykorzystuje 12 syntetycznych rozmów dwojga osób, łącznie 436,41 s i 855 słów
- Granica
- Rozmowa wstrzymana do przeglądu (skarga, pieniądze, nieustalony termin, prośba o człowieka) nie uruchomi syntezy; głos pochodzi z zamkniętego katalogu, bez klonowania
- Koszt
- 0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
- Bezpieczeństwo
- Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
- Tempo
- Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.
- Ślad
- Każde ustalenie wskazuje właściwy moment rozmowy, a wydanie odpowiedzi wymaga zapisanej zgody.
- Budowa podobnego systemu
- od 15 000 zł netto · 2–6 tygodni
Kurs referencyjny do przeliczeń: 1 USD = 3,72 zł; 1 EUR = 4,30 zł. Kwoty w PLN są zaokrąglone, a waluta pomiaru pozostaje podana w nawiasie.
Granica głosu
Człowiek zatwierdza każdą odpowiedź głosową
Oddzwanianie, wysyłka i zamykanie spraw zostają po stronie zespołu. Skarga, sprawa płatności, nieustalony termin i prośba o rozmowę z człowiekiem zostają w przeglądzie niezależnie od tego, jak dobry jest transkrypt. Odpowiedź głosem firmy zwalnia wskazana osoba, a jej wpis zostaje w łańcuchu audytu. Wersja demonstracyjna zapisuje ten wpis i nie uwierzytelnia tożsamości; podstawa prawna nagrywania, retencja, uprawnienia i usuwanie na żądanie należą do środowiska docelowego i potwierdza się je osobno.
- Granica
- Rozmowa wstrzymana do przeglądu (skarga, pieniądze, nieustalony termin, prośba o człowieka) nie uruchomi syntezy; głos pochodzi z zamkniętego katalogu, bez klonowania
- Koszt
- 0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
- Bezpieczeństwo
- Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
- Tempo
- Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.
Pierwszy korpus poszedł do kosza
Pierwsza wersja nagrań powstała lokalnie w eSpeak i nie nadawała się do niczego: syntezator formantowy słychać po dwóch sekundach, a transkrypt takiego pliku nie mówi nic o rozmowie z klientem. Zbudowaliśmy korpus od nowa, na mowie neuronowej w 16 głosach katalogowych, i nadal nazywamy go tym, czym jest. Stąd druga uwaga: tylko jeden z 47 głosów dostępnych na naszym kluczu jest zweryfikowany dla polszczyzny w wersji męskiej, więc część mówców niesie lekki obcy akcent. Zgodność podziału na mówców wynosi 100% dlatego, że tury w korpusie rozdziela cisza; przy nakładaniu się głosów rozmówców spadnie i to jest pierwsza rzecz, którą mierzylibyśmy na połączeniach klienta.
Szacowany efekt
Policz efekt na swoim wolumenie
To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Wynik potwierdzamy dopiero podczas pilotażu.
Dziś
Założenie dziś: 90 h/mies. (18 min/nagranie)
Po uruchomieniu
Scenariusz po: 30 h/mies. (6 min/nagranie)
Oszczędność czasu lub kosztu
Scenariusz modelowany: 45-75 h/mies., baza 60 h
- Wolumen
- Scenariusz modelowany: 300 nagrań/mies.
- Formuła
- 300 x (18 - 6) min / 60 = 60 h/mies.
- Status wyliczenia
- średnia
Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są syntetyczne. Dane klientów pozostają prywatne. Pomiary dotyczą opisanej wersji demonstracyjnej i są wyraźnie oddzielone od wyników produkcyjnych.
Powierzchnie pracy
Konsultant pracuje na ustaleniach, a odpowiedź głosem firmy zwalnia wskazana osoba i to jej wpis zostaje w audycie.
Konsultant zaczyna dzień od listy ustaleń z terminami, a każde z nich prowadzi jednym kliknięciem do sekundy, w której padło. Sprawy wrażliwe czekają na sprawdzenie. Odpowiedź głosowa wychodzi dopiero po zatwierdzeniu przez człowieka i zostawia wpis w audycie. Na połączeniach klienta trzeba jeszcze zmierzyć jakość transkrypcji przy szumie, akcencie i nakładających się głosach, trafność wyciągania ustaleń oraz rzeczywisty koszt minuty w obie strony.
Trzy ekrany po rozmowie: taśma, ustalenia, zwolnienie.
Taśma rozmowy
Fala nagrania, transkrypt i ustalenia na jednej osi czasu; kliknięcie w ustalenie odtwarza sekundę, w której padło.
Lista ustaleń
Ustalenia z właścicielem, terminem i pewnością, ze sprawami wrażliwymi odłożonymi do przeglądu.
Zwolnienie odpowiedzi
Szkic, powód wstrzymania, pole recenzenta i historia wydań, każda pozycja z wpisem w audycie.
Ekrany systemu
Zobacz, jak system działa w praktyce
To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.
- Ekrany
- 11
- px
- 1440 · 390
- 021440×1100
Taśma, transkrypt i wydanie głosu za bramką człowieka. - 031440×1100
Stół odsłuchu w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
- 041440×1100
Prośba o rozmowę z człowiekiem - 051440×1100
Ustalenia - 061440×1100
Do przeglądu - 071440×1100
Wydania głosowe - 081440×1100
Wydanie gotowe - 091440×1100
Wydanie wstrzymane - 101440×1100
Wydanie zapisane - 111440×1100
Rejestr pomiaru
Stos technologiczny
Cała trudność siedzi w jednym warunku przed syntezą, więc stos jest krótki.
Tu nie ma pętli, którą trzeba orkiestrować. Rozmowa przechodzi przez transkrypcję, wyciągnięcie ustaleń i jedną warunkową transakcję wydania, więc wystarczą FastAPI i PostgreSQL. Polski zapis mowy ze znacznikiem przy każdym słowie i rozdziałem mówców jest pracą specjalistyczną, dlatego oba kierunki obsługuje ElevenLabs w wariancie z rezydencją danych w Unii. Audyt zaczyna się od jednego warunku w kodzie i kontroli strukturalnych, które przechodzą bez klucza do dostawcy, więc utrzymanie nie zależy od dostępu do konta.
- ElevenLabs Scribe v2
- zapisuje polską rozmowę w słowa ze znacznikiem czasu i rozdziałem mówców
- ElevenLabs eleven_multilingual_v2
- syntezuje odpowiedź wyłącznie głosem z zamkniętej listy katalogowej
- FastAPI (Python 3.13)
- trzyma bramkę wydania oraz limity długości audio i tekstu przed żądaniem
- PostgreSQL 17
- stan rozmów, ustaleń i szkiców oraz dopisywany łańcuch audytu
- MinIO
- prywatne kubełki na audio źródłowe i wydane, podawane przez proxy
- Next.js 16
- sześć ekranów stołu odsłuchu, z pełnym renderem z ziarna korpusu
Klient przejmuje kod, instrukcje dla modeli, dane testowe i dokumentację, a całość działa jako zestaw kontenerów w jego infrastrukturze. Używamy ElevenLabs w wariancie z rezydencją danych w Unii. Interfejs syntezy nie przyjmuje próbki cudzego głosu, bo nie ma takiego parametru.
Szczegóły techniczne i pomiar
Pętla pracy
Nagranie, słowa i odpowiedzialność zostają na jednej osi czasu.
Każde ustalenie prowadzi do swojego fragmentu audio, a każda wypowiedziana odpowiedź do osoby, która ją zwolniła. Bramka wydania jest jednym warunkiem w transakcji bazodanowej, więc da się ją przeczytać i przetestować bez klucza do dostawcy.
Nagranie rozmowy w wydzielonym magazynie
Znacznik czasu przy każdym słowie → ustalenia z właścicielem i terminem
Skarga, pieniądze, nieustalony termin, prośba o człowieka → przegląd
Szkic odpowiedzi → zapisane zwolnienie przez recenzenta
Głos ze słyszalną zapowiedzią i wpisem w łańcuchu hashy
Architektura systemu
Magazyn audio, transkrypt, bramka wydania i łańcuch audytu.
Pliki w prywatnych kubełkach MinIO, stany rozmów i szkiców w PostgreSQL, dostawca mowy za endpointem z rezydencją danych w Unii, a warunek wydania egzekwowany po stronie serwera, poza zasięgiem interfejsu.
- 01
Materiał
Nagranie jest powiązane ze sprawą.
Plik audio leży w prywatnym kubełku MinIO i jest podawany przez proxy walidujące ścieżkę. Rozmowa, transkrypt i ustalenia wskazują to samo źródło. Limity 60 sekund audio i 360 znaków tekstu działają przed żądaniem do dostawcy. Wersja demonstracyjna nie dowodzi kontroli dostępu do nagrań.
- 02
Ustalenia
Słowa mają czas, ustalenia mają właściciela.
Scribe v2 zwraca znacznik przy każdym słowie i rozdziela mówców, więc ustalenie wskazuje dokładny zakres nagrania, osobę odpowiedzialną i termin. Kontrola strukturalna sprawdza, że każde ustalenie cytuje zapisany transkrypt słowo w słowo.
- 03
Bramka
Wydanie jest atomowe i warunkowe.
Szkic można wydać tylko raz i tylko wtedy, gdy rozmowa nie jest wstrzymana. Synteza głosu uruchamia się dopiero po zatwierdzeniu, więc sam szkic nie ma dostępu do funkcji, która tworzy wypowiedź. Wpis osoby zatwierdzającej zostaje w audycie; w wersji pokazowej jej tożsamość nie jest uwierzytelniana.
- 04
Zapowiedź i ślad
Głos przedstawia się, audyt pamięta.
Tekst syntezy zaczyna się od słyszalnej informacji, że mówi system, a głos pochodzi z zamkniętego katalogu: interfejs nie ma parametru, którym dałoby się podać próbkę cudzego głosu. Wydanie i wywołania narzędzi wchodzą do ciągłego łańcucha hashy.
Dlaczego głos stoi za kilkoma bramkami
Odpowiedzi wypowiedzianej głosem firmy nie da się cofnąć tak jak maila. Dlatego system sprawdza stan szkicu, politykę wstrzymania, zapisane zwolnienie, zamknięty katalog głosów i obowiązkową zapowiedź. Jeden warunek i jedna transakcja wystarczają do tego procesu; graf ani pętla agentowa nie są potrzebne. Kontrole strukturalne można uruchomić bez klucza dostawcy.
- Audio nie istnieje przed zapisanym zwolnieniem
- Wstrzymany szkic jest odrzucany przed wywołaniem dostawcy
- Głos pochodzi z zamkniętego katalogu, bez klonowania
- Zapowiedź systemu jest częścią każdej syntezy
- Limity 60 s audio i 360 znaków działają przed żądaniem
Chcesz sprawdzić podobny proces w swojej firmie?
- 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
- Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
- Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
Terminy zobaczysz w swojej strefie czasowej.
Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.