Nagranie pozostaje źródłem / 02SI · L00P.AI

Napisy na żywo potrzebują historii zmian

Koncepcja pilotażu: wersja wstępna, jawna korekta i osobny pomiar opóźnień. Otwórz fikcyjną historię jednego fragmentu.

2026-09-26 · 1.0 · PL / EN

01 / Szybkość nie kończy pracy

Na ekranie pojawia się zdanie. Po chwili system rozdziela głosy, a później redaktor poprawia nazwisko. Dla odbiorcy to wciąż ta sama wypowiedź. Jeśli każda nowa informacja usuwa poprzednią wersję bez śladu, trudno zrozumieć, co właściwie się zmieniło.

Proponujemy napisy, które potrafią przyznać: „to wersja wstępna”, a następnie pokazać korektę. Celem jest dostęp do treści rozmowy, także dla osób głuchych i słabosłyszących. Nie zakładamy, że wszyscy odbiorcy czytają w tym samym tempie lub chcą takich samych sygnałów.

To karta koncepcji do pilotażu, rozwinięta z notatki projektowej z 5 września 2026 r. Przykład poniżej jest fikcyjny. Nie odbiera anteny i nie dowodzi działania usługi napisów na żywo.

02 / Jedna wypowiedź, różne rodzaje wiedzy

Słowa, rozróżnienie głosów i potwierdzenie osoby to odrębne informacje. Każda może dotrzeć w innym momencie i każda może wymagać poprawki. Zdjęcie rozmówcy jest jeszcze inną warstwą: potrzebuje właściwego przypisania i praw do wykorzystania.

Proponowany zapis zachowuje stały identyfikator fragmentu oraz czas w oryginalnym nagraniu. Kolejna wersja wskazuje, które pole zmieniono, skąd pochodzi zmiana i kto ją zatwierdził. Czas wypowiedzi nie staje się czasem nadejścia poprawki.

Rozpoznanie głosu może dostarczyć propozycji podpisu. Nie powinno samo zamieniać jej w pewnik. Jak pokazuje poradnik o przedstawianiu rozmówców, brak alarmu nie potwierdza tożsamości. Ramówka i podpis mikrofonu także wymagają sprawdzenia z rzeczywistym przebiegiem rozmowy.

03 / Otwórz kolejne wersje

Wymyślony fragment S-17 obejmuje sekundy 12–16 nagrania. W pierwszej wersji napis brzmi „Spotkanie w czwartek”. Kolejna wersja dodaje etykietę „Mówca A”, bez nazwiska. Dopiero odsłuch w scenariuszu ujawnia słowo „wtorek”; osobno redaktor potwierdza fikcyjną Annę Nowak. Zmiana słowa i zmiana podpisu mają różne uzasadnienia.

PRZYKŁAD FIKCYJNY / bez nagrania

Wersja 1 · S-17 · 12–16 s

Nieustalony

Spotkanie w czwartek

Wstępna transkrypcja w scenariuszu.

Wersja 2 · S-17 · 12–16 s

Mówca A

Spotkanie w czwartek

Rozdzielenie głosów; tożsamość nadal nieustalona.

Wersja 3 · S-17 · 12–16 s

Mówca A

Spotkanie we wtorek

Korekta słowa po fikcyjnym odsłuchu przez redaktora.

Wersja 4 · S-17 · 12–16 s

Anna Nowak — osoba fikcyjna

Spotkanie we wtorek

Osobne potwierdzenie podpisu przez redaktora w scenariuszu.

Każdy panel można otworzyć niezależnie, także klawiaturą. Nic nie przewija się automatycznie. Wszystkie wersje pozostają w tekście MD i JSON. Ten demonstrator pokazuje historię, a nie algorytm transkrypcji; redaktor i odsłuch są elementami wymyślonej sytuacji, nie wykonanym testem audio.

04 / Mierz opóźnienie, nie tylko pracę modelu

Budżet zaczyna się od ustalonego punktu w dźwięku, a kończy na wyświetleniu napisu u odbiorcy. Trzeba uwzględnić zbieranie fragmentu, oczekiwanie w kolejce, przetwarzanie, przesłanie i wyświetlenie. Dla warstw działających równolegle nie sumuj ich czasów tak, jakby zawsze czekały jedna na drugą.

Oto wyłącznie przykładowe założenia dla czterech kolejnych etapów pierwszego napisu: 1,2 s buforowania, 0,8 s kolejki i przetwarzania, 0,4 s przesłania oraz 0,1 s wyświetlenia. Razem 2,5 s. Nie są to pomiary, cel umowny ani obietnica produktu.

Założony budżet kolejnych etapów: bufor 1,2 s; kolejka i przetwarzanie 0,8 s; przesłanie 0,4 s; ekran 0,1 s. Suma 2,5 s. To przykład, nie pomiar.
Autorski schemat, Codex / L00P.AI. Długość paska oznacza założony czas; skala 0–2,5 s. Nie obejmuje późniejszej identyfikacji i korekt.

W pilotażu zapisuj osobno czas pierwszego tekstu, późniejszego podpisu i korekty człowieka. Podaj punkt odniesienia, liczbę próbek, warunki obciążenia, medianę i wolniejsze przypadki. Opóźnienie względem źródła oraz różnica między napisami i odtwarzanym strumieniem to dwa różne pomiary. Zachowaj również odsetek brakujących fragmentów i liczbę korekt zmieniających sens.

05 / Czytelnik musi panować nad ekranem

Znaczenie nie może zależeć wyłącznie od koloru. Etykieta „Mówca A” powinna pozostać czytelna bez rozróżniania barw; zmiana potrzebuje opisu. To odpowiada zasadzie WCAG 1.4.1 — użycie koloru.

Projekt powinien zapewnić stabilny widok, kontrolę przewijania i wyraźny powrót do bieżącego miejsca. WCAG 2.2.2 opisuje warunki zatrzymywania ruchu i automatycznych aktualizacji. Wstrzymanie widoku nie oznacza zatrzymania audycji: pokaż, że odbiorca czyta wcześniejszy fragment.

Napisy mogą przekazywać także istotny śmiech, muzykę czy zmianę osoby, gdy są potrzebne do zrozumienia treści. Wyjaśnia to W3C przy napisach na żywo. Kryterium 1.2.4 dotyczy mediów zsynchronizowanych; nie przedstawiamy go jako automatycznego obowiązku dla każdego strumienia samego radia ani jako certyfikatu tego prototypu.

06 / Co mamy, a czego nie potwierdziliśmy

Notatka z 5 września wymieniała istniejące komponenty pobierania dźwięku, transkrypcji, rozdzielania głosów i bazy rozmówców. Jednocześnie oznaczała model rewizji, stronę napisów i widoczne korekty jako pracę do zbudowania. To stan opisany w dokumencie, nie dzisiejszy odbiór działającej całości.

W tym wydaniu wykonano publiczny przykład wersji, schemat budżetu oraz kontrolę plików i strony. Nie testowano anteny, opóźnień produkcji, obsługi czytników ekranu ani użyteczności z odbiorcami. Wibracje, fotografie, osobny strumień mowy i integracja ze źródłem pozostają poza demonstratorem. Nie przenosimy historycznych cen, progów rozpoznania ani twierdzeń o korzyściach medycznych.

07 / Mały pilotaż z warunkami odbioru

Zacznij od nagrania, do którego masz odpowiednie prawa, z ustalonym tekstem i listą mówców. Dopiero później przejdź do kontrolowanej transmisji. Uzgodnij z uczestnikami zakres udostępniania i przechowywania materiału. Przetestuj pomylone nazwisko, nakładające się głosy, brak fragmentu i utratę połączenia.

  • Czy odbiorca rozpoznaje wersję wstępną i potrafi znaleźć uzasadnienie korekty?
  • Czy czytane miejsce pozostaje stabilne, gdy przychodzi nowy tekst?
  • Czy opóźniona, starsza wersja nie zastępuje nowszej, a ponowione zdarzenie nie dubluje napisu?
  • Czy interfejs działa klawiaturą, z powiększeniem i z uzgodnionymi technologiami asystującymi?

Kryteria i dopuszczalne opóźnienia należy uzgodnić przed próbą z osobami, które będą używać napisów. Dopiero ich udział pozwoli ocenić, czy rozwiązanie pomaga. Zapraszamy do rozmowy o takim pilotażu: na początek wystarczy opis audycji i potrzeb odbiorców.

08 / Źródła i udział SI

Całą notatkę projektową przeczytano, a wskazane objaśnienia W3C sprawdzono 26 września 2026 r. Dokument źródłowy inspiruje koncepcję; jego historyczne liczby nie zostały uznane za aktualne pomiary. Dane przykładu — JSON PL/EN zawierają fikcyjne rewizje i założenia rachunku.

Codex opracował tekst PL/EN, SVG i demonstrator. Odbiór jest autorski, bez niezależnego drugiego modelu. Nie użyto cudzych nagrań, fotografii ani prawdziwych danych rozmówców. Wynik pilotażu, zmiana źródła lub znaleziony błąd uruchamia ponowny przegląd. Człowiek może wycofać publikację.