Przejdź do głównej treści

Grok klonuje głos — od nagrania do modelu w dwie minuty

xAI uruchomiło Custom Voices — funkcję klonowania głosu dostępną bezpośrednio w Grok. Kilka sekund nagrania wystarczy, żeby uzyskać gotowy model głosu w czasie krótszym niż dwie minuty. Model trafia do konsoli xAI i można go od razu używać w Text to Speech i Voice Agent API. Dostęp jest bezpłatny, a obok możliwości tworzenia własnych głosów działa biblioteka ponad 80 gotowych modeli w 28 językach.

Bezpieczeństwo jest tu przemyślane. Przed utworzeniem każdego głosu system przeprowadza dwuetapową weryfikację: użytkownik odczytuje frazę weryfikacyjną, a silnik STT porównuje nagranie z transkrypcją w czasie rzeczywistym — potwierdza obecność i intencję. Następnie system porównuje charakterystyki głosowe z klipu weryfikacyjnego i pełnego nagrania, żeby upewnić się, że to ta sama osoba.

Jedna z wymienionych aplikacji szczególnie mnie tu interesuje: tworzenie spersonalizowanego głosu dla osób, które utraciły zdolność mowy. To klasyczne zastosowanie z obszaru AAC (augmentative and alternative communication) — możliwość zachowania własnego głosu, zanim choroba go odbierze. Technologia klonowania głosu jest tu od kilku lat, ale wejście kolejnego, dużego dostawcy z prostym narzędziem obniża próg wejścia.

Warto przeczytać w całości: Custom Voices and Voice Library (xAI)