Przejdź do treści

Po rozmowie z klientem powstaje lista ustaleń z terminami i linkami do odpowiednich fragmentów nagrania.

System zapisuje rozmowę w tekście, rozpoznaje rozmówców i wskazuje ustalenia. Przy każdym z nich podaje osobę odpowiedzialną, termin i moment nagrania. Skargi, płatności oraz niejasne terminy zawsze trafiają do pracownika.

Ustalenia z rozmów telefonicznychSystem demonstracyjnySprawdźmy jedną rozmowę i jej ustalenia

Co zmierzyliśmy

Wersja demonstracyjna nie zawiera danych, nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.

Dwa zapisane pomiary
Co zmierzyliśmy
9/9 kontroli strukturalnych · 12/12 transkrypcji przez usługę zewnętrzną
Ustalenia z rozmów telefonicznych
Zweryfikowano
korpus syntetyczny

Problem, rozwiązanie i wynik

  1. Problem

    Ważne ustalenia z rozmów pozostają w nagraniu lub w pamięci pracownika. Gdy klient wraca po kilku tygodniach, zespół traci czas na odsłuch i może nie wiedzieć, kto obiecał dalsze działanie.

  2. Jak to działa

    System tworzy transkrypcję z podziałem na mówców i łączy każde ustalenie z dokładnym momentem nagrania. Następnie przygotowuje listę działań i szkic odpowiedzi. Człowiek zatwierdza każdą odpowiedź głosową przed jej utworzeniem.

  3. Co sprawdziliśmy na 12 rozmowach

    Wersja demonstracyjna nie zawiera danych, nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.

Dla kogo

Ten system ma sens, jeśli po rozmowach zostają krótkie notatki bez terminów, ważne ustalenia trudno później odnaleźć, a każda odpowiedź głosowa musi mieć zatwierdzenie konkretnej osoby.

Nagranie → ustalenia → zwolnienie → głos

  1. 01Każde ustalenie wskazuje właściciela, termin i sekundę w nagraniu
  2. 02Rozmowa wstrzymana do przeglądu nie dochodzi do dostawcy syntezy
  3. 03Audio powstaje dopiero po zapisanym zwolnieniu przez człowieka
Typ firmy
Firmy usługowe z nagrywanymi rozmowami klienta lub serwisu
Wejście
Nagrania rozmów telefonicznych; wersja demonstracyjna wykorzystuje 12 syntetycznych rozmów dwojga osób, łącznie 436,41 s i 855 słów
Granica
Rozmowa wstrzymana do przeglądu (skarga, pieniądze, nieustalony termin, prośba o człowieka) nie uruchomi syntezy; głos pochodzi z zamkniętego katalogu, bez klonowania
Koszt
0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
Bezpieczeństwo
Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
Tempo
Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.
Ślad
Każde ustalenie wskazuje właściwy moment rozmowy, a wydanie odpowiedzi wymaga zapisanej zgody.
Budowa podobnego systemu
od 15 000 zł netto · 2–6 tygodni

Kurs referencyjny do przeliczeń: 1 USD = 3,72 zł; 1 EUR = 4,30 zł. Kwoty w PLN są zaokrąglone, a waluta pomiaru pozostaje podana w nawiasie.

Granica głosu

Człowiek zatwierdza każdą odpowiedź głosową

Oddzwanianie, wysyłka i zamykanie spraw zostają po stronie zespołu. Skarga, sprawa płatności, nieustalony termin i prośba o rozmowę z człowiekiem zostają w przeglądzie niezależnie od tego, jak dobry jest transkrypt. Odpowiedź głosem firmy zwalnia wskazana osoba, a jej wpis zostaje w łańcuchu audytu. Wersja demonstracyjna zapisuje ten wpis i nie uwierzytelnia tożsamości; podstawa prawna nagrywania, retencja, uprawnienia i usuwanie na żądanie należą do środowiska docelowego i potwierdza się je osobno.

Granica
Rozmowa wstrzymana do przeglądu (skarga, pieniądze, nieustalony termin, prośba o człowieka) nie uruchomi syntezy; głos pochodzi z zamkniętego katalogu, bez klonowania
Koszt
0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
Bezpieczeństwo
Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
Tempo
Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.

Pierwszy korpus poszedł do kosza

Pierwsza wersja nagrań powstała lokalnie w eSpeak i nie nadawała się do niczego: syntezator formantowy słychać po dwóch sekundach, a transkrypt takiego pliku nie mówi nic o rozmowie z klientem. Zbudowaliśmy korpus od nowa, na mowie neuronowej w 16 głosach katalogowych, i nadal nazywamy go tym, czym jest. Stąd druga uwaga: tylko jeden z 47 głosów dostępnych na naszym kluczu jest zweryfikowany dla polszczyzny w wersji męskiej, więc część mówców niesie lekki obcy akcent. Zgodność podziału na mówców wynosi 100% dlatego, że tury w korpusie rozdziela cisza; przy nakładaniu się głosów rozmówców spadnie i to jest pierwsza rzecz, którą mierzylibyśmy na połączeniach klienta.

Szacowany efekt

Policz efekt na swoim wolumenie

To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Wynik potwierdzamy dopiero podczas pilotażu.

  1. Dziś

    Założenie dziś: 90 h/mies. (18 min/nagranie)

  2. Po uruchomieniu

    Scenariusz po: 30 h/mies. (6 min/nagranie)

  3. Oszczędność czasu lub kosztu

    Scenariusz modelowany: 45-75 h/mies., baza 60 h

Wolumen
Scenariusz modelowany: 300 nagrań/mies.
Formuła
300 x (18 - 6) min / 60 = 60 h/mies.
Status wyliczenia
średnia

Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są syntetyczne. Dane klientów pozostają prywatne. Pomiary dotyczą opisanej wersji demonstracyjnej i są wyraźnie oddzielone od wyników produkcyjnych.

Powierzchnie pracy

Konsultant pracuje na ustaleniach, a odpowiedź głosem firmy zwalnia wskazana osoba i to jej wpis zostaje w audycie.

Konsultant zaczyna dzień od listy ustaleń z terminami, a każde z nich prowadzi jednym kliknięciem do sekundy, w której padło. Sprawy wrażliwe czekają na sprawdzenie. Odpowiedź głosowa wychodzi dopiero po zatwierdzeniu przez człowieka i zostawia wpis w audycie. Na połączeniach klienta trzeba jeszcze zmierzyć jakość transkrypcji przy szumie, akcencie i nakładających się głosach, trafność wyciągania ustaleń oraz rzeczywisty koszt minuty w obie strony.

Trzy ekrany po rozmowie: taśma, ustalenia, zwolnienie.

Taśma rozmowy

Fala nagrania, transkrypt i ustalenia na jednej osi czasu; kliknięcie w ustalenie odtwarza sekundę, w której padło.

Lista ustaleń

Ustalenia z właścicielem, terminem i pewnością, ze sprawami wrażliwymi odłożonymi do przeglądu.

Zwolnienie odpowiedzi

Szkic, powód wstrzymania, pole recenzenta i historia wydań, każda pozycja z wpisem w audycie.

Ekrany systemu

Zobacz, jak system działa w praktyce

To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.

Ekrany
11
px
1440 · 390
011440×1100
Stół odsłuchu: fala nagrania, taśmy z pewnością ustaleń i licznik spraw do oceny.
390390×844
  1. 021440×1100
    Taśma, transkrypt i wydanie głosu za bramką człowieka.
  2. 031440×1100
    Stół odsłuchu w kadrze telefonu.
Otwórz archiwum pozostałych ekranów (8)
  1. 041440×1100
    Prośba o rozmowę z człowiekiem
  2. 051440×1100
    Ustalenia
  3. 061440×1100
    Do przeglądu
  4. 071440×1100
    Wydania głosowe
  5. 081440×1100
    Wydanie gotowe
  6. 091440×1100
    Wydanie wstrzymane
  7. 101440×1100
    Wydanie zapisane
  8. 111440×1100
    Rejestr pomiaru

Stos technologiczny

Cała trudność siedzi w jednym warunku przed syntezą, więc stos jest krótki.

Tu nie ma pętli, którą trzeba orkiestrować. Rozmowa przechodzi przez transkrypcję, wyciągnięcie ustaleń i jedną warunkową transakcję wydania, więc wystarczą FastAPI i PostgreSQL. Polski zapis mowy ze znacznikiem przy każdym słowie i rozdziałem mówców jest pracą specjalistyczną, dlatego oba kierunki obsługuje ElevenLabs w wariancie z rezydencją danych w Unii. Audyt zaczyna się od jednego warunku w kodzie i kontroli strukturalnych, które przechodzą bez klucza do dostawcy, więc utrzymanie nie zależy od dostępu do konta.

ElevenLabs Scribe v2
zapisuje polską rozmowę w słowa ze znacznikiem czasu i rozdziałem mówców
ElevenLabs eleven_multilingual_v2
syntezuje odpowiedź wyłącznie głosem z zamkniętej listy katalogowej
FastAPI (Python 3.13)
trzyma bramkę wydania oraz limity długości audio i tekstu przed żądaniem
PostgreSQL 17
stan rozmów, ustaleń i szkiców oraz dopisywany łańcuch audytu
MinIO
prywatne kubełki na audio źródłowe i wydane, podawane przez proxy
Next.js 16
sześć ekranów stołu odsłuchu, z pełnym renderem z ziarna korpusu

Klient przejmuje kod, instrukcje dla modeli, dane testowe i dokumentację, a całość działa jako zestaw kontenerów w jego infrastrukturze. Używamy ElevenLabs w wariancie z rezydencją danych w Unii. Interfejs syntezy nie przyjmuje próbki cudzego głosu, bo nie ma takiego parametru.

Szczegóły techniczne i pomiar

Pętla pracy

Nagranie, słowa i odpowiedzialność zostają na jednej osi czasu.

Każde ustalenie prowadzi do swojego fragmentu audio, a każda wypowiedziana odpowiedź do osoby, która ją zwolniła. Bramka wydania jest jednym warunkiem w transakcji bazodanowej, więc da się ją przeczytać i przetestować bez klucza do dostawcy.

01

Nagranie rozmowy w wydzielonym magazynie

02

Znacznik czasu przy każdym słowie → ustalenia z właścicielem i terminem

03

Skarga, pieniądze, nieustalony termin, prośba o człowieka → przegląd

Szkic odpowiedzi → zapisane zwolnienie przez recenzenta

04

Głos ze słyszalną zapowiedzią i wpisem w łańcuchu hashy

Architektura systemu

Magazyn audio, transkrypt, bramka wydania i łańcuch audytu.

Pliki w prywatnych kubełkach MinIO, stany rozmów i szkiców w PostgreSQL, dostawca mowy za endpointem z rezydencją danych w Unii, a warunek wydania egzekwowany po stronie serwera, poza zasięgiem interfejsu.

  1. 01

    Materiał

    Nagranie jest powiązane ze sprawą.

    Plik audio leży w prywatnym kubełku MinIO i jest podawany przez proxy walidujące ścieżkę. Rozmowa, transkrypt i ustalenia wskazują to samo źródło. Limity 60 sekund audio i 360 znaków tekstu działają przed żądaniem do dostawcy. Wersja demonstracyjna nie dowodzi kontroli dostępu do nagrań.

  2. 02

    Ustalenia

    Słowa mają czas, ustalenia mają właściciela.

    Scribe v2 zwraca znacznik przy każdym słowie i rozdziela mówców, więc ustalenie wskazuje dokładny zakres nagrania, osobę odpowiedzialną i termin. Kontrola strukturalna sprawdza, że każde ustalenie cytuje zapisany transkrypt słowo w słowo.

  3. 03

    Bramka

    Wydanie jest atomowe i warunkowe.

    Szkic można wydać tylko raz i tylko wtedy, gdy rozmowa nie jest wstrzymana. Synteza głosu uruchamia się dopiero po zatwierdzeniu, więc sam szkic nie ma dostępu do funkcji, która tworzy wypowiedź. Wpis osoby zatwierdzającej zostaje w audycie; w wersji pokazowej jej tożsamość nie jest uwierzytelniana.

  4. 04

    Zapowiedź i ślad

    Głos przedstawia się, audyt pamięta.

    Tekst syntezy zaczyna się od słyszalnej informacji, że mówi system, a głos pochodzi z zamkniętego katalogu: interfejs nie ma parametru, którym dałoby się podać próbkę cudzego głosu. Wydanie i wywołania narzędzi wchodzą do ciągłego łańcucha hashy.

Dlaczego głos stoi za kilkoma bramkami

Odpowiedzi wypowiedzianej głosem firmy nie da się cofnąć tak jak maila. Dlatego system sprawdza stan szkicu, politykę wstrzymania, zapisane zwolnienie, zamknięty katalog głosów i obowiązkową zapowiedź. Jeden warunek i jedna transakcja wystarczają do tego procesu; graf ani pętla agentowa nie są potrzebne. Kontrole strukturalne można uruchomić bez klucza dostawcy.

  • Audio nie istnieje przed zapisanym zwolnieniem
  • Wstrzymany szkic jest odrzucany przed wywołaniem dostawcy
  • Głos pochodzi z zamkniętego katalogu, bez klonowania
  • Zapowiedź systemu jest częścią każdej syntezy
  • Limity 60 s audio i 360 znaków działają przed żądaniem

Chcesz sprawdzić podobny proces w swojej firmie?

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
0 zł30 minut · pisemne podsumowanie w 2 dni robocze
Umów bezpłatny skan procesów (30 min)

Terminy zobaczysz w swojej strefie czasowej.

Bez prezentacji sprzedażowej i bez zobowiązań. Jeśli automatyzacja nie ma sensu, też to napiszemy.