Przejdź do treści

Tekst na mowę AI za darmo. Trzy ścieżki, które mówią po polsku

Rejestr pomiarowy: zielona strefa Tekst na mowę z plakietką Za darmo i trzy kropkowane ścieżki do kart Przeglądarka, Gemini 3.8 TTS i ElevenLabs; trzy razy 0 zł, po polsku; stan 30.09.2026

Dwudziestego trzeciego września Google wypuścił dwa modele do zamiany tekstu na mowę, Gemini 3.8 Flash TTS i Flash-Lite TTS, i oba od pierwszego dnia są dostępne za darmo na poziomie darmowym API oraz w AI Studio. Po polsku mówią od razu, dokumentacja wymienia nasz język wprost na liście obsługiwanych. To dobry moment, żeby poukładać w jedną całość to, co ludzie masowo wpisują w wyszukiwarkę od dawna: tekst na mowę ai, zamiana tekstu na mowę za darmo, darmowy lektor ai, syntezator mowy.

W tym poradniku przechodzę przez trzy ścieżki, które realnie kosztują zero złotych: czytnik wbudowany w przeglądarkę, nowy Gemini TTS w AI Studio i dziesięć minut miesięcznie w ElevenLabs. Na końcu jest ściąga, a w środku jeszcze jedna droga, całkiem bez internetu, którą przetestowaliśmy na zwykłym procesorze, bez karty graficznej.

Spis treści:

Najpierw zdecyduj: czytasz dla siebie, czy nagrywasz

Zamiana tekstu na mowę służy w praktyce dwóm różnym rzeczom. Pierwsza to odczytanie czegoś dla siebie: artykułu, PDF-a, długiego dokumentu, kiedy oczy są zajęte albo tekst ma osiem tysięcy słów. Druga to zrobienie nagrania, które gdzieś wstawisz: lektora do filmu, głosu do prezentacji, wersji audio własnej notatki.

Od tego rozróżnienia zależy wybór ścieżki. Do czytania dla siebie wystarczy przeglądarka, bez żadnego konta i bez limitów. Do nagrań potrzebujesz narzędzia AI, a tam pojawiają się limity dobowe, licencje i pytanie, co dzieje się z twoim tekstem na cudzym serwerze. W tabelkach porównawczych te trzy rzeczy giną najczęściej, a to one rozstrzygają wybór.

Czytnik w przeglądarce: odczyt bez konta i limitów

Microsoft Edge ma wbudowaną funkcję Czytaj na głos. Klikasz prawym przyciskiem na otwartej stronie albo PDF-ie, wybierasz odczyt i słuchasz. Konto nie jest potrzebne, licznik nie istnieje, a głosy przychodzą z systemu. Gdy brakuje pakietu językowego, doinstalowuje się go w ustawieniach Windows (Czas i język, następnie Mowa), co Microsoft opisuje krok po kroku na stronie wsparcia. W Wordzie działa z tej samej rodziny Przeczytaj na głos, przydatne przy dokumentach, które masz otwarte w edytorze.

Do czytania długich tekstów ta ścieżka wygrywa bez walki. Ma jedną twardą granicę: nie dostaniesz z niej pliku z nagraniem. Funkcja gra na żywo i niczego nie zapisuje, więc na lektora do filmu się nie nadaje. Do tego potrzebujesz modelu, który wygeneruje plik audio na twoje zlecenie.

Gemini 3.8 TTS: darmowa nowość Google z 23 września

Google ogłosiło oba modele 23 września i nazwało je swoimi najbardziej ekspresyjnymi modelami audio do tej pory. Gemini 3.8 Flash TTS to wersja pełna, Flash-Lite tańsza i szybsza, celowana w duże wolumeny typu dubbing czy głosowe agenty. Dokumentacja API, aktualizowana dzień po premierze, mówi wprost: polski obsługiwany na obu modelach, łącznie Flash deklaruje ponad 130 języków, Flash-Lite ponad 100. Język rozpoznawany jest z samego tekstu, nie trzeba nic przełączać.

Dokumentacja Gemini API po polsku, strona Generowanie tekstu na mowę (TTS): interfejs przekształca tekst na dźwięk z jednym lub wieloma mówcami, ze stylami, tagami głosowymi i metadanymi tury
Zrzut ekranu: ai.google.dev, 30.09.2026.

Wejście dla człowieka bez zaplecza programistycznego wygląda tak: logujesz się zwykłym kontem Google w AI Studio, gdzie jest osobny tryb generowania mowy. Wybierasz jeden z 30 fabrycznych głosów o nazwach w stylu Zephyr, Kore czy Puck, wklejasz tekst i słuchasz wyniku. Do tego dochodzi biblioteka rozszerzona z setkami głosów, a łącznie Google deklaruje ponad dwa tysiące głosów gotowych do pracy w API. Tekst można reżyserować linię po linii: wtrącać pauzy, śmiech albo westchnienie tagami w rodzaju <short pause> czy <laugh>, opisywać styl wypowiedzi jako na przykład radosny i przyjazny, a w jednej scenie rozmawiać dwoma głosami naraz.

Koszty wyglądają tak. W AI Studio korzystanie jest bezpłatne we wszystkich regionach, bez karty płatniczej. W API oba modele też mają poziom darmowy, free of charge, z dobowymi limitami zapytań. Google nie publikuje już jawnej tabeli liczb dla poszczególnych modeli, limity widać dopiero po zalogowaniu w AI Studio, a licznik dobowy resetuje się o północy czasu pacyficznego. Dla skali: płatnie wychodzi około 0,002 dolara za dziesięć sekund nagrania, więc nawet stawki komercyjne są tu symboliczne.

Jest w tym wszystkim jeden zapis, który łatwo przewinąć. Na poziomie darmowym cennik Google zaznacza wprost, że firma może używać twoich zapytań do trenowania własnych produktów. Przy tekście, który i tak wrzucasz publicznie, to bez znaczenia. Przy czegokolwiek poufnym, już nie. Ten sam mechanizm opisywaliśmy przy okazji ciasteczka __obi, którym ChatGPT zbierał dane o odwiedzanych stronach. Zapis o trenowaniu stoi w cenniku na widoku, w kolumnie poziomu darmowego.

Na marginesie: replikacja czyjegoś głosu z 30-sekundowej próbki wymaga według Google weryfikacji zgody mówcy, a wygenerowane nagrania są znakowane watermarkiem SynthID. Zaznaczam, że to deklaracje producenta, nie nasza weryfikacja. Nawigacja po nowych modelach jest prosta: gemini-3.8-flash-tts i gemini-3.8-flash-lite-tts to nazwy aktualne, starsze pozycje z dopiskiem preview zostają w dokumentacji dla istniejących projektów.

ElevenLabs: dziesięć minut miesięcznie na start

Druga ścieżka to ElevenLabs, usługa płatna z założenia, ale z planem darmowym, na którym da się realnie pracować. Dostajesz 10 tysięcy kredytów miesięcznie, zamiana tekstu na mowę kosztuje jeden kredyt za znak, a cennik w podsumowaniu planu przelicza to na około dziesięć minut nagrania. Kredytów nie przenosisz na kolejny miesiąc, więc jeśli masz dłuższy scenariusz, dziel go na raty albo czekaj na odnowienie. W pakiecie są też efekty dźwiękowe, projektowanie własnego głosu i trzy projekty w Studio.

Cennik ElevenLabs: plan Free za 0 dolarów miesięcznie z funkcjami Text to Speech, Speech to Text, Sound Effects i 10 tysiącami kredytów, obok Startera za 6 dolarów z licencją komercyjną i 30 tysiącami kredytów
Zrzut ekranu: elevenlabs.io/pricing, 30.09.2026.

Polski jest wspierany i to nie marketingowo: dokumentacja wymienia go wprost na liście 29 języków modelu Multilingual v2, a nowsze modele deklarują 74 języki. Najważniejsza różnica wobec Gemini siedzi jednak w licencji. Plan darmowy nie obejmuje praw do użytku komercyjnego, ta pojawia się dopiero w Starterze za 6 dolarów miesięcznie. Audio, które wygenerujesz, pozostaje twoje, ale jeśli chcesz na nim zarabiać, potrzebujesz planu płatnego. Do testów, podcastu hobbystycznego albo głosu w szkolnej prezentacji to bez znaczenia. Dla kanału, który monetyzuje, już tak.

Jeśli rozważysz kiedyś plan płatny, cennikiem tego i kilku innych narzędzi dzielimy się w tabeli narzędzi AI, aktualizowanej z oficjalnych stron.

Całkiem bez internetu: Piper i głosy systemowe

Trzecia droga omija serwery w ogóle. Polska ma tu długą historię: IVONA z Gdańska była tak dobrym syntezatorem, że w styczniu 2013 kupił ją Amazon, a TechCrunch wiózł wtedy tytuł o konkurencji dla Siri. Stąd sentymentalne zapytania o syntezator mowy ivona, które wciąż żyją w podpowiedziach Google.

Współczesnym odpowiednikiem tamtej epoki, tyle że otwartym i darmowym, jest Piper: mały model neuronowy działający na zwykłym procesorze. Przetestowaliśmy go trzydziestego września na maszynie bez karty graficznej. Instalacja to jedno polecenie, polski głos darkman to plik o rozmiarze 63 MB z repozytorium Hugging Face, a tekst 160 znaków zamienił się w 11,8 sekundy dźwięku w ciągu 1,4 sekundy czasu zegara. Plik WAV, 22 kHz, mono, zero połączenia z siecią w trakcie pracy.

Karta testu Pipera z 30 września 2026: polski głos darkman, model 63 MB pobrany z Hugging Face, 160 znaków tekstu zamienione w 11,8 sekundy dźwięku w 1,4 sekundy na procesorze bez internetu, plik WAV 22 kHz mono
Ilustracja stylizowana, nie zrzut ekranu. Wyniki testu z 30.09.2026.
pip install piper-tts
python3 -m piper -m pl_PL-darkman-medium.onnx -f nagranie.wav < tekst.txt

Jak taki głos brzmi, ocenisz sam, model ściągniesz w minutę i nie zapłacisz nic. Jakości audio nie oceniamy w tym tekście na słuch. Dla większości ludzi wariant offline to ciekawostka albo zapas na moment, gdy łącze zawodzi. Jest jednak scenariusz, w którym wygrywa z resztą od razu: teksty, których nie chcesz wysyłać żadnej firmie, bo nic nie opuszcza twojego komputera.

Ściąga: która ścieżka do czego

CelŚcieżkaKosztGłówny limit
Przeczytać artykuł albo PDFCzytaj na głos w Edge0 złbrak, działa bez konta
Nagranie po polsku na własne potrzebyGemini 3.8 TTS w AI Studio0 złdobowe limity, na free trening produktów Google
Próba lektora do filmuElevenLabs, plan darmowy0 zł10 minut miesięcznie, bez licencji komercyjnej
Teksty poufne albo praca offlinePiper lub głosy systemowe0 złjakość zależy od wybranego głosu

Nota uczciwości

Ścieżki opisujemy według oficjalnej dokumentacji i cenników z 30 września 2026. Nie zakładaliśmy kont w AI Studio ani w ElevenLabs, więc ścieżek w interfejsach nie potwierdzaliśmy na żywych profilach. Jakości brzmienia głosów nie oceniamy na słuch; benchmarki i deklaracje producentów przytaczamy jako ich twierdzenia. Jedyny test przeprowadzony w całości u nas to Piper w sekcji offline, z liczbami podanymi przy opisie.

Źródła

  1. DeepMind: Say hello to Gemini 3.8 text to speech, 23.09.2026
  2. Dokumentacja Gemini API: Text-to-speech generation, aktualizacja 24.09.2026
  3. Cennik Gemini Developer API, aktualizacja 24.09.2026
  4. ElevenLabs: Pricing, stan na 30.09.2026
  5. ElevenLabs: Text to Speech, dokumentacja
  6. Microsoft: Pobieranie języków i głosów dla czytnika immersyjnego, trybu czytania i funkcji Czytaj na głos
  7. Piper, repozytorium na GitHubie oraz polskie głosy na Hugging Face
  8. TechCrunch: Amazon Gets Into Voice Recognition, Buys Ivona Software, 24.01.2013
  9. TLDR AI z 24.09.2026, sygnał o premierze

Powiązane artykuły