[AI] Natywne generowanie głosów
Google I/O 2025 – rewolucja AI z Veo 3 i natywnym generowaniem głosu
Google I/O 2025 przejdzie do historii jako wydarzenie, które na nowo zdefiniowało granice sztucznej inteligencji. Konferencja, która odbyła się 20 maja 2025 roku była prawdziwym pokazem siły technologii AI, a Google po raz kolejny udowodniło, że nie zamierza ustępować konkurencji. Od nowych możliwości modelu Gemini, przez futurystyczne Google Beam, po zaawansowane narzędzia do tworzenia treści – nowości jest mnóstwo. Ale to Veo 3 i natywne generowanie głosów w Google AI Studio skradły show, wywołując fale dyskusji w sieci. Przyjrzyjmy się bliżej tym przełomowym rozwiązaniom, ze szczególnym naciskiem na generowanie dźwięku, które osobiście uważam za prawdziwy game-changer (choć to tylko moje zdanie, bo zdaje sobie sprawę że dla większości to pewnie Veo 3 jest znacznie ciekawsze).
Veo 3 – wideo z dźwiękiem, które szokuje
Veo 3 to skok w przyszłość. Model potrafi tworzyć filmy w rozdzielczości do 4K, które nie tylko wyglądają fotorealistycznie, ale też brzmią jak prawdziwe produkcje. Wpisujesz krótki opis, np. „samotny wędrowiec na pustyni, w tle burza piaskowa i dramatyczna muzyka”, a Veo 3 generuje nie tylko obraz, ale też idealnie zsynchronizowany dźwięk – od szumu wiatru po kroki na piasku. To, co kiedyś wymagało ekipy filmowej, teraz powstaje w kilka minut. Nie dziwi więc, że internet oszalał na punkcie tego narzędzia – od memów z gadającymi muffinkami po fałszywe gameplay’e z Fortnite, które wyglądają niemal jak prawdziwe. Ale choć Veo 3 oszałamia, to natywne generowanie głosów w Google AI Studio skradło moje serce.
Natywne generowanie głosów – magia w Google AI Studio
Google AI Studio to plac zabaw dla fanów technologii, a nowa funkcja natywnego generowania głosów to prawdziwy klejnot. Działa to tak: wpisujesz tekst, określając tonację, emocje czy nawet specyficzne cechy głosu (np. „radośnie podekscytowany” albo „dramatyczny szept”), a system generuje mowę, która brzmi jak nagrana przez człowieka. To nie jest kolejny syntetyczny głos, który kojarzy się z asystentami z lat 90. – to pełen emocji, dynamiczny dźwięk, który potrafi się śmiać, krzyczeć, a nawet wyrażać subtelne niuanse, jak niepewność czy entuzjazm.
Jak to działa w praktyce? W Google AI Studio wybierasz głos, a następnie tworzysz i wklejasz skrypt. Osobiście (żeby było mi szybciej i efektywniej) przygotowałem sobie prompta, po wpisaniu którego pisze jedynie krótko jaki ma być głos, a w feedbacku otrzymuje dokładnie rozpisany głos + tekst do wklejenia. Czyli np wpisuje (cytat):
Teraz głos robotyczny, który informuję o konieczności naprawy jakiegoś akumulatora na statku kosmicznym. To głos jak z gier np half-life, taki bez emocji, po prostu głos statku kosmicznego
I odpowiedź zwrotna:
Głos Robota Pokładowego
Opis głosu: Głos jest monotonny, metaliczny i syntetyczny, pozbawiony jakichkolwiek emocji czy intonacji. Brzmi jak cyfrowy komunikat generowany przez system komputerowy, z lekkim, stałym pogłosem. Każde słowo jest wymawiane z jednakową głośnością i tempem, bez akcentowania, co podkreśla jego maszynową naturę.
Tekst do przeczytania:
"Uwaga. Wykryto... krytyczną... awarię... systemu... zasilania... głównego... akumulatora... numer... siedem. Wymagana... natychmiastowa... interwencja... konserwacyjna. Szacowany... czas... do... całkowitego... rozładowania... akumulatora... wynosi... piętnaście... minut... i... trzydzieści... sekund. Proszę... udać... się... do... sekcji... technicznej... Beta-3... i... rozpocząć... procedurę... naprawczą. Powtarzam... komunikat."
Testowałem to osobiście, generując próbki w różnych tonacjach – od radosnego śmiechu po pełen paniki głos. Wyniki możecie je sprawdzić sami, bo przygotowałem kilka przykładów:
[Link do próbki 1 – plotki mówione szeptem z chichotem]
[Link do próbki 2 – kobieta śmieje się i opowiada dowcipy o testerach oprogramowania]
[Link do próbki 3 – mężczyzna się śmieje (nie może się powstrzymać) i opowiada dowcipy o Jasiu]
[Link do próbki 4 – kobieta, głos systemowy z jakiegoś statku kosmicznego]
[Link do próbki 5 – komentator piłki nożnej]
[Link do próbki 6 – kobieta, głos paniki]
[Link do próbki 7 – mężczyzna, stand-up]
To, co robi największe wrażenie, to synchronizacja emocji z treścią. Jeśli w tekście jest wykrzyknik, system automatycznie podbija ekspresję. Jeśli opisujesz nastrój, AI dopasowuje ton i tempo.
Co to oznacza dla przyszłości?
Na razie natywne generowanie głosów dostępne jest tylko w Google AI Studio, ale plotki głoszą, że wkrótce trafi do aplikacji Gemini, prawdopodobnie w ramach subskrypcji AI Pro lub Ultra. Kiedy to się stanie, wkroczymy w zupełnie nową erę cyfrowych interakcji, no bo dostaniemy asystenta AI, który nie tylko odpowiada na pytania, ale robi to z taką intonacją i emocjami, że czujesz, jakbyś rozmawiał z przyjacielem.
Moim zdaniem stoimy u progu czasów, w których cyfrowi towarzysze (nie wiem, czy to najlepsze określenie, ale oddaje ducha!) staną się nieodłączną częścią naszego życia. Jeśli już teraz trudno odróżnić generowany głos od ludzkiego, to co będzie za rok czy dwa? Może niedługo będziemy prowadzić rozmowy z AI, które będą tak naturalne, że zapomnimy, że to nie człowiek. To zarówno ekscytujące, jak i trochę niepokojące – bo gdzie jest granica między rzeczywistością a symulacją?
Podsumowanie
Google I/O 2025 to pokaz możliwości, które jeszcze niedawno wydawały się science-fiction. Veo 3 zrewolucjonizowało generowanie wideo, ale to natywne generowanie głosów w Google AI Studio jest dla mnie prawdziwym przełomem. Możliwość tworzenia realistycznych, pełnych emocji głosów otwiera drzwi do niezliczonych zastosowań – od twórczości artystycznej po personalizowane interakcje z AI. Zachęcam do przetestowania moich próbek i podzielenia się wrażeniami. Ciekawi mnie, czy za kilka tygodni/miesięcy wszyscy z takich głosów i rozmów będziemy mogli korzystać bezpośrednio w Gemini (dla mnie na bank będzie wtedy rewolucja i ludzie będą chętnie rozmawiali z takimi głosami) i dlaczego (bo Veo 3 pokazuje że to żaden problem) natywne generowanie głosów ignoruje generowanie dźwięków tła, choć domyślam się że absolutnie nie chodzi o to że się nie da, ale o kwestie bezpieczeństwa.

Komentarze
Prześlij komentarz