NA ŻYWO 
NASŁUCH: 11 ŹRÓDEŁ ZE ŚWIATA · DZIŚ 3 NEWSÓW
Skip to content
PILNEUnia karze AliExpress za podróbki - a ja i tak dalej zamawiam. Dlaczego kara nic nie zmieniaDZIŚ
NASŁUCHUJEMY ŚWIATA · przepisujemy po polsku z podaniem źródłaThe VergeArs TechnicaTechCrunchWiredEngadgetHacker NewsMIT Tech ReviewThe RegisterTom's Hardware404 MediaRest of World
AI

OpenAI GPT-Live - rozmowa z AI, która wreszcie nie udaje głuchej

OpenAI uruchomiło GPT-Live z modelami GPT-Live-1 i GPT-Live-1 mini - asystentami głosowymi full-duplex, które słuchają i mówią jednocześnie i delegują trudne zadania do GPT-5.5.

9 min read
OpenAI GPT-Live - rozmowa z AI, która wreszcie nie udaje głuchej

Ponad 150 milionów ludzi co tydzień rozmawia z ChatGPT głosem. Do tej pory większość tych rozmów brzmiała jak dzwonienie na infolinię - model czekał na ciszę, żeby wiedzieć, że skończyłeś zdanie, a jeśli przez chwilę się zawahałeś, wchodził ci w słowo. Od 8 lipca 2026 roku OpenAI oficjalnie to kończy.

GPT-Live to trzecia generacja głosowej technologii ChatGPT i jednocześnie najbardziej ambitna zmiana architektury od czasu pojawienia się Zaawansowanego Trybu Głosowego. Nie chodzi tu o ładniejszy głos ani szybsze odpowiedzi. Chodzi o to, że model przestał udawać, że jest telefonem z jednym kanałem dźwiękowym.

OpenAI GPT-Live - rozmowa z AI, która wreszcie nie udaje głuchej

Dwa modele trafiają dziś globalnie na iOS, Android i chatgpt.com: GPT-Live-1 dla użytkowników płatnych planów Go, Plus i Pro oraz GPT-Live-1 mini dla kont darmowych. Architektura inna niż wszystko, co OpenAI wypuściło wcześniej w warstwie głosowej - i tutaj zaczyna się najciekawsza część tej historii.

Koniec z czekaniem na ciszę

Żeby zrozumieć, co OpenAI zmieniło, trzeba cofnąć się do tego, jak poprzednie systemy w ogóle działały. Oryginalny ChatGPT Voice łączył trzy komponenty szeregowo: model zamieniający mowę na tekst, duży model językowy i model zamieniający tekst z powrotem na mowę - układ, który tracił informacje na każdym etapie przejścia. Zaawansowany Tryb Głosowy naprawił to w połowie drogi - przetwarzał dźwięk w jednym modelu, ale nadal działał w trybie zmianowym.

OpenAI GPT-Live - rozmowa z AI, która wreszcie nie udaje głuchej

Zaawansowany Tryb Głosowy przetwarzał i generował dźwięk w jednym modelu, co zmniejszało opóźnienia i usprawniało rozmowy - ale nadal działał przez oddzielne tury. Model musiał czekać, aż użytkownik skończy mówić, zanim zaczął odpowiadać. W efekcie nawet krótka pauza lub szum w tle mógł zostać odczytany jako koniec tury - powodując przerywanie w nieodpowiednich momentach.

GPT-Live to inne podejście do fundamentów. Kluczową zmianą techniczną jest to, co OpenAI nazywa architekturą pełnodupleksową. W telekomunikacji pełny dupleks oznacza, że obie strony rozmowy telefonicznej mogą mówić i słuchać jednocześnie. W zastosowaniu do sztucznej inteligencji oznacza to, że model stale przetwarza przychodzący dźwięk nawet podczas generowania własnej odpowiedzi - koniec z czekaniem na wyraźną pauzę, żeby zorientować się, czy skończyłeś myśl.

Zamiast przetwarzać sekwencję oddzielnych wiadomości, GPT-Live stale przetwarza dane wejściowe, jednocześnie generując wyjście. Model może zatem podejmować decyzje interakcyjne wiele razy na sekundę: czy mówić, nadal słuchać, zrobić pauzę, przerwać rozmowę, czy wywołać narzędzie. To brzmi jak detal implementacyjny. W praktyce zmienia całe odczucie rozmowy.

Protip ✅

Jeśli GPT-Live zacznie za często wtrącać „mhmm” i „tak” - możesz po prostu poprosić go głosem, żeby był spokojniejszy i słuchał więcej. Model reaguje na takie meta-instrukcje w trakcie rozmowy, bez konieczności restartowania sesji.

Dwie mózgownie w jednej rozmowie

Pełny dupleks to połowa innowacji. Druga połowa jest równie sprytna i bardziej strategiczna. GPT-Live nie jest modelem, który sam musi wiedzieć wszystko. W przypadku pytań wymagających przeszukania sieci, głębszego rozumowania lub bardziej złożonych zadań, model oddelegowuje pracę do najnowszego modelu granicznego działającego w tle i wprowadza wyniki do rozmowy, gdy są gotowe. Podczas gdy model pracuje, GPT-Live może kontynuować rozmowę i utrzymywać jej przepływ. Na starcie GPT-Live korzysta z GPT-5.5 w tle.

To architektoniczne rozdzielenie warstwy konwersacyjnej od warstwy rozumowania jest kluczowe. GPT-Live jest przede wszystkim odpowiedzialny za utrzymanie płynności i naturalnego rytmu rozmowy. Gdy napotka zadania wymagające przeszukiwania sieci, głębokiego rozumowania lub złożonych operacji agentowych, oddelegowuje je do wydajniejszego modelu działającego w tle. Na starcie tym modelem zaplecza jest GPT-5.5, a OpenAI zapowiedziało, że będzie nadal aktualizować to wsparcie w miarę wydawania nowych modeli. Ten zdecentralizowany projekt pozwala asystentowi głosowemu utrzymywać naturalną interakcję z użytkownikiem nawet podczas intensywnych obliczeń w tle, unikając niezręcznych długich pauz.

Efekt uboczny tej architektury jest strategicznie istotny. GPT-Live nie próbuje zastąpić GPT-5.5 - orkiestruje go. Warstwa głosowa zarządza relacją - rytmem, sygnałami zwrotnymi, komfortem ciszy - a ciężkie obliczenia oddelegowuje do mocniejszego modelu tylko wtedy, gdy jest to potrzebne. OpenAI zbudowało coś, co można by porównać do interfejsu: wymienialny silnik pod spodem, stała twarz na wierzchu.

Co mówią liczby (i co przemilczają)

OpenAI zbudowało nowe testy z udziałem ludzi, mierzące przyjemność rozmowy i jej przepływ. W tych bezpośrednich porównaniach GPT-Live-1 i GPT-Live-1 mini były zdecydowanie preferowane nad Zaawansowanym Trybem Głosowym w dopasowanych 5-10 minutowych rozmowach mierzących ogólne wrażenia, zmianę tur, przerywanie, płynność konwersacji i naturalność interakcji.

Na testach technicznych wyniki również robią wrażenie. Na teście porównawczym GPQA, który testuje rozumowanie naukowe na poziomie eksperckim z biologii, chemii i fizyki, GPT-Live-1 wyraźnie przewyższa Zaawansowany Tryb Głosowy. Na BrowseComp - testującym autonomiczne przeszukiwanie sieci i zdolność do znajdowania trudno dostępnych informacji - GPT-Live-1 pokazuje znaczące przewagi. Na wewnętrznym wariancie τ³-Voice Telecom, testującym agentów głosowych w realistycznych wieloturowych zadaniach obsługi telekomunikacyjnej, GPT-Live-1 również bije poprzednika.

Według OpenAI, GPT-Live-1 uzyskał wynik 75.5, plasując się wyraźnie powyżej poprzedniego modelu głosowego ChatGPT. Ale warto zachować zdrowy sceptycyzm: to OpenAI ocenia OpenAI, na testach przygotowanych przez OpenAI. Rzeczywista wartość tych wyników zależy mniej od deklarowanych zysków z testów porównawczych, a bardziej od tego, czy model utrzyma poziom poza zastosowaniami z dominującym angielskim, gdzie demo już pokazało potknięcia.

Uwaga ⚠️

GPT-Live na starcie nie obsługuje wideo ani udostępniania ekranu. Jeśli korzystasz z tych funkcji w Zaawansowanym Trybie Głosowym, nie znajdziesz ich jeszcze w nowym interfejsie - OpenAI zapowiada ich dodanie w przyszłości, bez konkretnych dat.

Bezpieczeństwo głosem - i problem złudnej intymności

Karta systemowa GPT-Live opublikowana wraz z ogłoszeniem opisuje strategię bezpieczeństwa zbudowaną wokół szczególnych zagrożeń wynikających z interakcji głosowej w czasie rzeczywistym - domeny, gdzie szybkość i intymność rozmowy tworzą zagrożenia, których tekst nie generuje. Firma zbudowała zabezpieczenia działające w czasie rzeczywistym, które mogą interweniować w trakcie wypowiedzi modelu - kierując go ku bezpieczniejszym odpowiedziom, wyświetlając informacje kryzysowe lub całkowicie kończąc sesję głosową w sytuacjach wysokiego ryzyka.

OpenAI przeprowadziło nowe testy bezpieczeństwa natywne dla dźwięku i poddało GPT-Live czerwonemu zespołowi pod kątem ryzyk specyficznych dla głosu, w tym samookaleczeń, psychozy i manii, emocjonalnego uzależnienia od sztucznej inteligencji, przemocy i treści seksualnych.

Aby zapobiec oszustwom związanym z klonowaniem głosu, GPT-Live jest ściśle ograniczony do używania tylko wstępnie zdefiniowanych głosów i bezwzględnie nie oferuje możliwości naśladowania głosów prawdziwych osób. Ważnym kontekstem jest tu głośna kontrowersja z 2024 roku, gdy GPT-4o został uruchomiony z głosem „Sky”, który był bardzo podobny do głosu aktorki Scarlett Johansson - OpenAI usunęło później ten głos i przeprosiło.

Ale jest jeden problem, który OpenAI przyznaje otwarcie i który jest trudniejszy do rozwiązania niż klonowanie głosu. OpenAI przyznało, że „wdraża długoterminowe pomiary i monitoring po premierze skupiony na emocjonalnym uzależnieniu” - co jest de facto przyznaniem, że sama naturalność, do której GPT-Live dąży, tworzy własną kategorię ryzyka. Model mówi „mhmm” w odpowiednim momencie, czeka cierpliwie, gdy się wahasz, i nigdy nie mówi, że ma gorszy dzień. To nie jest tylko doświadczenie użytkownika. To budowanie nawyku.

Konkurencja: pełny dupleks przestał być przewagą

Podczas gdy OpenAI dopracowywało swoje zabezpieczenia, rywale wypuszczali własne systemy pełnodupleksowe. Google’s Gemini Live obsługuje rozmowy pełnodupleksowe wraz z kamerą i udostępnianiem ekranu - możliwości, których GPT-Live wyraźnie brakuje na starcie - i jest już dostępne w aplikacji Gemini.

ByteDance uruchomił Seeduplex w kwietniu, deklarując bycie pierwszym systemem sztucznej inteligencji pełnodupleksowej wdrożonym w skali produkcyjnej, w ramach aplikacji Doubao. Seeduplex odnotował redukcję fałszywych odpowiedzi i fałszywych przerywań o około 50 procent w porównaniu z poprzednim systemem półdupleksowym ByteDance. Nvidia wypuściła PersonaPlex w styczniu, wprowadzając do modeli pełnodupleksowych personalizację głosu i kontrolę roli - przełamując ograniczenie, w którym naturalnie brzmiące modele były przypisane do jednego, stałego głosu.

Obraz konkurencji jest jasny: interakcja głosowa pełnodupleksowa szybko staje się standardem dla konsumenckich produktów sztucznej inteligencji, nie wyróżnikiem. Przewaga OpenAI leży w skali istniejącej bazy użytkowników, integracji z możliwościami rozumowania GPT-5.5 i rozległości ekosystemu ChatGPT. Ale okno, w którym jakakolwiek jedna firma miałaby monopol na naturalnie brzmiący głosowy system sztucznej inteligencji, już się zamknęło.

Protip ✅

GPT-Live-1 najlepiej sprawdza się w dłuższych sesjach konwersacyjnych - szef ChatGPT Voice, Atty Eleti, przyznał, że podczas spacerów prowadzi z nim rozmowy trwające 30-40 minut. Jeśli masz plan Plus lub Pro, właśnie dostałeś narzędzie do długich sesji myślenia na głos.

Kto na tym zyska, kto straci

Ta premiera oznacza trzecią generację głosowej technologii ChatGPT w ciągu mniej więcej dwóch lat - i jednocześnie najbardziej bezpośrednią próbę OpenAI zamiany swojego chatbota w coś, co przypomina mniej odpytywanie wyszukiwarki, a bardziej rozmowę ze współpracownikiem.

Dla użytkowników darmowych zmiana jest konkretna: zamiast sztywnego Zaawansowanego Trybu Głosowego dostają GPT-Live-1 mini - coś, co faktycznie słucha w czasie rzeczywistym. OpenAI uważa, że głos może stać się głównym interfejsem do obsługi komputera przy złożonej pracy. Raporty sugerują, że firma może jeszcze w tym roku wypuścić słuchawki z wbudowanymi możliwościami sztucznej inteligencji. GPT-Live wygląda jak technologiczne przygotowanie pod ten sprzęt.

Dla firm i deweloperów czekanie trwa. OpenAI planuje udostępnić modele przez API, a deweloperzy mogą się zapisać na powiadomienia. Nie ma dat, nie ma szczegółów cennika. Ograniczone API czyta się jako decyzja „najpierw konsument” - OpenAI kupuje sobie czas na dopracowanie historii dla deweloperów.

I tu jest właściwa stawka: ponad 150 milionów ludzi co tydzień rozmawia z ChatGPT głosem lub dyktuje tekst, według OpenAI. To nie jest niszowa funkcja - to jeden z największych interfejsów głosowych na świecie. GPT-Live nie musi pokonać Google w laboratoriach. Musi utrzymać tych 150 milionów przy sobie, gdy Gemini Live oferuje kamerę, a kolejni gracze odejmują kolejne przewagi. Na razie OpenAI postawiło na naturalność rozmowy jako główny argument. Okaże się, czy użytkownicy cenią to bardziej niż dodatkowe możliwości rywali - ale fundament architektoniczny, który zbudowało, jest solidny.

Avatar photo

futurystyk.pl

ADMINISTRATOR

FUTURYSTYK to technologiczny nasluch swiata. Codziennie wybieramy najwazniejsze newsy o sprzecie, komponentach, AI, oprogramowaniu, nauce i kosmosie, sprawdzamy je w zagranicznych zrodlach i przepisujemy po polsku - konkretnie, bez sciemy i z podaniem skad to mamy.