Przejdź do treści

Po rozmowie z klientem powstaje lista ustaleń z terminami i linkami do odpowiednich fragmentów nagrania.

System zapisuje rozmowę w tekście, rozpoznaje rozmówców i wskazuje ustalenia. Przy każdym z nich podaje osobę odpowiedzialną, termin i moment nagrania. Skargi, płatności oraz niejasne terminy zawsze trafiają do pracownika.

Ustalenia z rozmów telefonicznychDostarczoneSprawdźmy jedną rozmowę i jej ustalenia

Co sprawdziliśmy

Publiczny podgląd korzysta z pakietu danych testowych i nie zawiera nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.

Dwa zapisane testy
Co sprawdziliśmy
9/9 kontroli strukturalnych · 12/12 transkrypcji przez usługę zewnętrzną
Ustalenia z rozmów telefonicznych
Zweryfikowano
korpus testowy

Problem, rozwiązanie i wynik

  1. Ustalenia zostawały w nagraniach i pamięci pracownika

    Ważne ustalenia z rozmów pozostają w nagraniu lub w pamięci pracownika. Gdy klient wraca po kilku tygodniach, zespół traci czas na odsłuch i może nie wiedzieć, kto obiecał dalsze działanie.

  2. Jak to działa

    System tworzy transkrypcję z podziałem na mówców i łączy każde ustalenie z dokładnym momentem nagrania. Następnie przygotowuje listę działań i szkic odpowiedzi. Człowiek zatwierdza każdą odpowiedź głosową przed jej utworzeniem.

  3. Co sprawdziliśmy na 12 rozmowach

    Publiczny podgląd nie zawiera danych, nagrań ani poświadczeń klientów. Sprawdza cały obieg, pięć wymaganych zatrzymań i utworzenie głosu dopiero po zatwierdzeniu. Nie sprawdza tożsamości osoby zatwierdzającej ani jakości na prawdziwych rozmowach klientów.

Dla kogo

Ten system ma sens, jeśli po rozmowach zostają krótkie notatki bez terminów, ważne ustalenia trudno później odnaleźć, a każda odpowiedź głosowa musi mieć zatwierdzenie konkretnej osoby.

Nagranie → ustalenia → zatwierdzenie → głos

  1. 01Każde ustalenie wskazuje osobę odpowiedzialną, termin i sekundę w nagraniu
  2. 02Rozmowa wstrzymana do przeglądu nie dochodzi do dostawcy syntezy
  3. 03Audio powstaje dopiero po zapisanym zatwierdzeniu przez człowieka
Typ firmy
Firmy usługowe z nagrywanymi rozmowami klienta lub serwisu
Wejście
Nagrania rozmów telefonicznych; publiczny przebieg wykorzystuje 12 testowych rozmów dwojga osób, łącznie 436,41 s i 855 słów
Zatwierdzenie głosu
Skarga, sprawa o pieniądze, nieustalony termin lub prośba o człowieka zatrzymują syntezę głosu. System korzysta z zamkniętego katalogu i nie klonuje głosów
Koszt
0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
Bezpieczeństwo
Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
Tempo
Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.
Źródło i zgoda
Każde ustalenie wskazuje właściwy moment rozmowy, a wydanie odpowiedzi wymaga zapisanej zgody.
Budowa podobnego systemu
od 15 000 zł netto · 2–6 tygodni

Do przeliczeń przyjęliśmy: 1 USD = 3,72 zł i 1 EUR = 4,30 zł. Kwoty w PLN są zaokrąglone, a waluta źródłowa pozostaje podana w nawiasie.

Zatwierdzenie głosu

Człowiek zatwierdza każdą odpowiedź głosową

Oddzwanianie, wysyłka i zamykanie spraw należą do zespołu. Skarga, sprawa płatności, nieustalony termin i prośba o rozmowę z człowiekiem zawsze wymagają przeglądu. Wskazana osoba zatwierdza utworzenie odpowiedzi głosowej, a system zapisuje tę decyzję. Publiczna wersja nie uwierzytelnia tożsamości zatwierdzającego. Podstawę prawną nagrywania, okres przechowywania, uprawnienia i usuwanie na żądanie ustala się osobno dla środowiska klienta.

Koszt
0,047770 USD za zapisany przebieg 12 transkrypcji i jednego zatwierdzonego komunikatu głosowego.
Bezpieczeństwo
Skarga, temat pieniędzy, nieustalony termin lub prośba o człowieka zatrzymują przygotowanie odpowiedzi głosowej.
Tempo
Czas transkrypcji i przygotowania odpowiedzi mierzymy w pilotażu na nagraniach klienta.

Pierwszy korpus poszedł do kosza

Pierwsze nagrania powstały lokalnie w eSpeak. Komputerowy głos brzmiał wyraźnie sztucznie, więc taki materiał nie nadawał się do oceny rozmów z klientem. Zbudowaliśmy zestaw od nowa z 16 głosów neuronowych. Tylko jeden z 47 głosów dostępnych na naszym kluczu jest zweryfikowany dla polszczyzny w wersji męskiej, dlatego u części mówców słychać lekki obcy akcent. Podział na mówców osiągnął 100%, ponieważ wypowiedzi oddziela cisza. Wynik zapewne spadnie przy nakładających się głosach i to trzeba sprawdzić na rozmowach klienta.

Szacowany efekt

Policz efekt na swoim wolumenie

To szacunek oparty na podanym wolumenie. Wpisz własne liczby do formuły, aby ocenić możliwy efekt w swojej firmie. Podczas pilotażu sprawdzamy go na danych procesu.

  1. Dziś

    Założenie dziś: 90 h/mies. (18 min/nagranie)

  2. Po uruchomieniu

    Scenariusz po: 30 h/mies. (6 min/nagranie)

  3. Oszczędność czasu lub kosztu

    Scenariusz modelowany: 45-75 h/mies., baza 60 h

Wolumen
Scenariusz modelowany: 300 nagrań/mies.
Formuła
300 x (18 - 6) min / 60 = 60 h/mies.
Status wyliczenia
średnia

Dane na zrzutach. Nazwy, kwoty i dokumenty widoczne na zrzutach są testowe. Dane klientów pozostają prywatne. Wyniki dotyczą opisanego testu; wpływ produkcyjny sprawdzamy na danych klienta.

Ekrany

Konsultant pracuje na ustaleniach, a wskazana osoba zatwierdza utworzenie odpowiedzi głosem firmy. Jej decyzja zostaje w historii.

Konsultant zaczyna dzień od listy ustaleń z terminami, a każde z nich prowadzi jednym kliknięciem do sekundy, w której padło. Sprawy wrażliwe czekają na sprawdzenie. Odpowiedź głosowa wychodzi dopiero po zatwierdzeniu przez człowieka i zostawia wpis w audycie. Na połączeniach klienta trzeba jeszcze zmierzyć jakość transkrypcji przy szumie, akcencie i nakładających się głosach, trafność wyciągania ustaleń oraz rzeczywisty koszt minuty w obie strony.

Trzy ekrany po rozmowie: nagranie, ustalenia i zatwierdzenie

Nagranie rozmowy

Fala nagrania, transkrypt i ustalenia na jednej osi czasu; kliknięcie w ustalenie odtwarza sekundę, w której padło.

Lista ustaleń

Ustalenia z osobą odpowiedzialną, terminem i oceną pewności. Sprawy wrażliwe są odłożone do przeglądu.

Zatwierdzenie odpowiedzi

Szkic, powód wstrzymania, osoba zatwierdzająca i historia utworzonych odpowiedzi.

Ekrany systemu

Zobacz, jak system działa w praktyce

To zrzuty z działającej aplikacji w wersji komputerowej i mobilnej. Pokazują opisany proces oraz miejsca, w których decyzję podejmuje człowiek.

Ekrany
11
px
1440 · 390
011440×1100
Panel odsłuchu: fala nagrania, ustalenia z oceną pewności i licznik spraw do oceny.
390390×844
  1. 021440×1100
    Nagranie, transkrypt i odpowiedź głosowa czekająca na zatwierdzenie człowieka.
  2. 031440×1100
    Panel odsłuchu na ekranie telefonu.
Otwórz archiwum pozostałych ekranów (8)
  1. 041440×1100
    Prośba o rozmowę z człowiekiem
  2. 051440×1100
    Ustalenia
  3. 061440×1100
    Do przeglądu
  4. 071440×1100
    Wydania głosowe
  5. 081440×1100
    Wydanie gotowe
  6. 091440×1100
    Wydanie wstrzymane
  7. 101440×1100
    Wydanie zapisane
  8. 111440×1100
    Rejestr testu

Stos technologiczny

FastAPI i PostgreSQL pilnują zatwierdzenia przed syntezą

Rozmowa przechodzi przez transkrypcję, wyodrębnienie ustaleń i jedną transakcję zatwierdzenia. FastAPI prowadzi ten proces, a PostgreSQL zapisuje stan. Rozpoznawanie polskiej mowy ze znacznikami czasu oraz syntezę obsługuje ElevenLabs w wariancie z rezydencją danych w Unii. Kontrole zatwierdzenia można uruchomić bez klucza dostawcy.

ElevenLabs Scribe v2
zapisuje polską rozmowę w słowa ze znacznikiem czasu i rozdziałem mówców
ElevenLabs eleven_multilingual_v2
syntezuje odpowiedź wyłącznie głosem z zamkniętej listy katalogowej
FastAPI (Python 3.13)
sprawdza zatwierdzenie oraz limity długości audio i tekstu przed wysłaniem żądania
PostgreSQL 17
przechowuje stan rozmów, ustaleń i szkiców oraz dopisywaną historię zmian
MinIO
prywatne kubełki na audio źródłowe i wydane, podawane przez proxy
Next.js 16
wyświetla sześć ekranów panelu odsłuchu na podstawie zapisanych danych testowych

Klient przejmuje kod, instrukcje dla modeli, dane testowe i dokumentację, a całość działa jako zestaw kontenerów w jego infrastrukturze. Używamy ElevenLabs w wariancie z rezydencją danych w Unii. Interfejs syntezy nie przyjmuje próbki cudzego głosu, bo nie ma takiego parametru.

Szczegóły techniczne i wyniki testów

Pętla pracy

Nagranie, transkrypt i ustalenia są połączone na jednej osi czasu

Każde ustalenie prowadzi do odpowiedniego fragmentu audio. Przy odpowiedzi głosowej widać osobę, która zatwierdziła jej utworzenie. Warunek zatwierdzenia jest zapisany w transakcji bazodanowej, dlatego można go przetestować bez dostępu do usługi syntezy.

01

Nagranie rozmowy w wydzielonym magazynie

02

Znacznik czasu przy każdym słowie → ustalenia z osobą odpowiedzialną i terminem

03

Skarga, pieniądze, nieustalony termin, prośba o człowieka → przegląd

Szkic odpowiedzi → zapisane zatwierdzenie przez pracownika

04

Głos ze słyszalną zapowiedzią i wpisem w łańcuchu hashy

Architektura systemu

Prywatny magazyn audio, transkrypt i zatwierdzenie odpowiedzi

Pliki są przechowywane w prywatnych zasobnikach MinIO, a stan rozmów i szkiców w PostgreSQL. Dostawca mowy działa w wariancie z rezydencją danych w Unii. Serwer sprawdza zgodę przed utworzeniem odpowiedzi głosowej.

  1. 01

    Materiał

    Nagranie jest powiązane ze sprawą

    Plik audio znajduje się w prywatnym zasobniku MinIO. Serwer sprawdza ścieżkę przed udostępnieniem nagrania. Rozmowa, transkrypt i ustalenia wskazują ten sam plik. Limity 60 sekund audio i 360 znaków tekstu działają przed żądaniem do dostawcy. Publiczna wersja nie dowodzi kontroli dostępu do nagrań klienta.

  2. 02

    Ustalenia

    Każde ustalenie wskazuje czas i osobę odpowiedzialną

    Scribe v2 zwraca znacznik czasu przy każdym słowie i rozdziela mówców. Ustalenie wskazuje dokładny fragment nagrania, osobę odpowiedzialną i termin. Kontrola sprawdza, czy cytowany fragment występuje w zapisanym transkrypcie słowo w słowo.

  3. 03

    Zatwierdzenie

    Odpowiedź można zatwierdzić tylko raz

    Synteza głosu uruchamia się dopiero po zatwierdzeniu i tylko dla rozmowy, która nie jest wstrzymana. Baza zapisuje tę operację jako jedną transakcję. Przy decyzji pozostaje wpis osoby zatwierdzającej. Publiczny podgląd nie uwierzytelnia jej tożsamości.

  4. 04

    Zapowiedź i zapis

    Odpowiedź informuje, że mówi system

    Tekst syntezy zaczyna się od słyszalnej informacji, że mówi system. Głos pochodzi z zamkniętego katalogu, a interfejs nie przyjmuje próbki cudzego głosu. Zatwierdzenie i wywołania narzędzi są zapisywane w łańcuchu skrótów.

Dlaczego odpowiedź głosowa wymaga kilku kontroli

Wysłanej odpowiedzi głosowej nie da się cofnąć. System sprawdza więc stan szkicu, przyczynę ewentualnego wstrzymania, zapisane zatwierdzenie, katalog głosów i obowiązkową zapowiedź. Wystarcza do tego jedna transakcja w bazie; graf ani pętla agenta nie są potrzebne. Kontrole można uruchomić bez klucza dostawcy.

  • Audio nie powstaje przed zapisanym zatwierdzeniem
  • Wstrzymany szkic jest odrzucany przed wywołaniem dostawcy
  • Głos pochodzi z zamkniętego katalogu, bez klonowania
  • Zapowiedź systemu jest częścią każdej syntezy
  • Limity 60 s audio i 360 znaków działają przed żądaniem

Chcesz sprawdzić podobny proces w swojej firmie?

  • 30 minut z inżynierem, który może prowadzić Twoje wdrożenie.
  • Przegląd procesów, które kosztują Cię najwięcej czasu i pieniędzy.
  • Pisemne podsumowanie: co zautomatyzować, w jakiej kolejności, z widełkami kosztów.
0 zł30 minut · pisemne podsumowanie w 2 dni robocze
Umów bezpłatny skan procesów (30 min)

Terminy zobaczysz w swojej strefie czasowej.

W 30 minut wybieramy proces do oceny, a w ciągu 2 dni roboczych dostajesz rekomendację, także gdy lepsza będzie prostsza droga.