
POLYGLOT AI
Lokalna platforma do nauki angielskiego, hiszpańskiego i włoskiego — od A1 do C2, całkowicie offline.
- PROJECT
- AI-048
- MODEL JĘZYKOWY
- QWEN 2.5 (LOKALNIE)
- ASR
- WHISPER large-v3 · GPU
- TTS
- PIPER · KOKORO · CHATTERBOX
- KURS
- 600+ LEKCJI · 24 000 ZDAŃ
- STATUS
- W TRAKCIE
- DATA
- 15 sierpnia 2026
Nauczyciel AI prowadzi rozmowy i lekcje po polsku, Whisper słucha, trzy silniki mowy odpowiadają, a osobny model ocenia wymowę fonem po fonemie z profilem typowych błędów Polaków. Po instalacji serwer pracuje offline — nagrania i dane nie opuszczają komputera.
PROBLEM
Aplikacje do nauki języków rozwiązują dobrze jeden fragment problemu — słownictwo — i pomijają ten, który decyduje o mówieniu: wymowę i rozmowę. Do tego wszystkie wysyłają nagranie głosu na serwer, co przy nauce codziennej oznacza oddanie na zewnątrz kilkuset nagrań własnego głosu miesięcznie.
Trzeci problem jest specyficznie polski: kursy uczą wymowy „ogólnie”, a Polak mówiący po angielsku ma zestaw błędów przewidywalny co do fonemu — spółgłoski międzyzębowe, mylenie w z v, końcówka -ed, brak geminat.
POMYSŁ
Zbudować platformę, w której wszystkie cztery role — nauczyciel, słuchacz, lektor i egzaminator wymowy — działają lokalnie, a ocena wymowy jest konkretna fonetycznie: nie „popraw akcent”, tylko „w tym słowie θ wyszło jako t, ustaw język między zębami”.
Kurs miał być przy tym realny, a nie demonstracyjny: pełna ścieżka CEFR od A1 do C2 z automatycznym awansem po zaliczeniu poziomu.
PROJEKT
Nauczyciel AI to lokalny model Qwen 2.5, który w jednym wywołaniu zwraca ocenę wypowiedzi i odpowiedź — połączenie tych dwóch kroków skraca opóźnienie o połowę i utrzymuje spójność między oceną a repliką. Wyjaśnienia idą po polsku, bo tłumaczenie gramatyki w języku obcym na poziomie A1 nie działa.
Rozpoznawanie mowy stoi na Whisperze large-v3 z akceleracją GPU, w czterech językach — trzech uczonych plus polski, potrzebny do rozumienia pytań ucznia.
Ocena wymowy jest osobnym silnikiem opartym na wav2vec2 z metryką GOP, z wbudowanym profilem typowych błędów Polaków i polskimi instrukcjami artykulacyjnymi. To najbardziej wyspecjalizowana część systemu i jednocześnie ta, której nie da się kupić gotowej.
Trzy silniki syntezy mowy pełnią różne role: Piper jest szybki, Kokoro ma naturalną prozodię i głosy męskie oraz żeńskie dla trzech języków, Chatterbox jest ekspresyjny. Przełączane per użytkownik.
REALIZACJA
Kurs liczy ponad 600 lekcji: dwanaście prowadzących plus lekcje generowane z autorskich banków 24 000 zdań, w tym moduły branżowe dotyczące łazienek i armatury — bezpośrednie połączenie z resztą działalności warsztatu.
Dialogi dwugłosowe czytane są dwoma różnymi głosami, a tryb „wchodzę w rolę” nagrywa ucznia bez klikania mikrofonu, z detekcją ciszy i oceną wymowy na żywo. Ta jedna decyzja zmienia charakter ćwiczenia: rozmowa przestaje być serią formularzy.
Powtórki planuje algorytm FSRS, osobno dla znaczenia, użycia, pisowni, wymowy i słuchu — bo opanowanie słowa w piśmie nie oznacza rozpoznania go ze słuchu.
EFEKT
Analiza programu nauczania jest udokumentowana osobno: macierz pokrycia CEFR, plan kursu w formacie JSON o objętości 110 kB oraz raporty importu dla każdego języka. Dryle obejmują dyktando, tłumaczenie z polskiego, poprawianie błędu (tysiąc typowych pomyłek na język), idiomy i kolokacje wpięte w powtórki.
WNIOSKI
Największą wartością okazała się specjalizacja pod jeden język ojczysty. Uniwersalna ocena wymowy mówi „prawie dobrze”; ocena wiedząca, że mówi Polak, wskazuje konkretny fonem i konkretną instrukcję — i to jest różnica między informacją a oceną.

