W długo oczekiwanym ogłoszeniu, które miało miejsce wczoraj w San Francisco, Sam Altman, CEO OpenAI, zaprezentował GPT-5 - najnowszą iterację ich flagowego modelu AI. Model wprowadza rewolucyjne ulepszenia w zakresie multimodalności i rozumienia kontekstu, które mogą na zawsze zmienić sposób, w jaki wchodzimy w interakcję ze sztuczną inteligencją.
Prawdziwa multimodalność
W przeciwieństwie do poprzednich wersji, które były głównie modelami językowymi z dodatkowymi możliwościami wizualnymi, GPT-5 został zaprojektowany od podstaw jako natywnie multimodalny system. To oznacza, że model "myśli" w tekście, obrazach, dźwięku i wideo jednocześnie, zamiast tłumaczyć między różnymi modalnościami.
"GPT-5 nie tylko widzi obraz i opisuje go słowami" - wyjaśnia Altman podczas prezentacji. "Model rozumie wizualne koncepcje w ten sam sposób, w jaki rozumie język. Może dyskutować o niuansach kompozycji artystycznej, analizować język ciała w filmach, czy nawet 'słyszeć' emocje w muzyce."
Kluczowe innowacje
Rozumienie wideo w czasie rzeczywistym: GPT-5 może przetwarzać strumienie wideo na żywo, analizując akcje, emocje i kontekst w czasie rzeczywistym. Demonstracja pokazała model komentujący mecz koszykówki, identyfikujący strategie zespołów i przewidujący potencjalne zagrania.
Zaawansowana analiza audio: Model rozpoznaje nie tylko słowa, ale także ton, emocje, akcent, a nawet tło dźwiękowe. Potrafi identyfikować instrumenty muzyczne, gatunki i wpływy stylistyczne w utworach muzycznych.
Generowanie multimediów: GPT-5 może tworzyć nie tylko tekst, ale również obrazy, muzykę i krótkie klipy wideo, wszystko zintegrowane w jednej rozmowie. Użytkownik może poprosić o "stworzenie krótkiego klipu promocyjnego z muzyką i narracją" i otrzymać kompletny produkt.
Wydajność i benchmarki
OpenAI opublikowało imponujące wyniki testów:
- MMLU: 97.3% (nowy rekord)
- HumanEval (kodowanie): 96.8%
- MATH: 95.7%
- ImageNet (rozpoznawanie obrazów): 99.1%
- AudioSet (klasyfikacja dźwięku): 97.4%
Szczególnie imponujące są wyniki w nowych benchmarkach multimodalnych, gdzie GPT-5 przewyższa konkurencję średnio o 15-20 punktów procentowych.
Rozszerzone okno kontekstu
GPT-5 oferuje okno kontekstu do 1 miliona tokenów - wystarczającego do przetworzenia całej powieści, godzin materiału wideo, lub setek stron dokumentacji technicznej w jednym zapytaniu. Model może utrzymywać spójność i kontekst na tak długich dystansach, co otwiera nowe możliwości dla analizy dokumentów i badań.
Ulepszone rozumowanie
Model wykorzystuje nową architekturę "rozumowania wieloetapowego", która pozwala mu rozkładać złożone problemy na mniejsze kroki i weryfikować swoje odpowiedzi przed przedstawieniem ich użytkownikowi. W testach wewnętrznych OpenAI, to podejście zredukowało liczbę błędów logicznych o 78% w porównaniu do GPT-4.
Bezpieczeństwo i alignment
OpenAI kładzie szczególny nacisk na bezpieczeństwo. GPT-5 przeszedł rozszerzony proces "red teaming" z udziałem ponad 500 ekspertów z różnych dziedzin. Model został wytrenowany z wykorzystaniem nowych technik Constitutional AI i RLHF (Reinforcement Learning from Human Feedback).
"Zainwestowaliśmy równie dużo zasobów w bezpieczeństwo co w możliwości modelu" - podkreśla Mira Murati, CTO OpenAI. "GPT-5 jest nie tylko potężniejszy, ale również bardziej kontrolowalny i przewidywalny."
Dostępność i ceny
GPT-5 będzie dostępny poprzez API OpenAI od przyszłego tygodnia. Ceny wynoszą:
- Input: 20 USD za milion tokenów
- Output: 60 USD za milion tokenów
- Przetwarzanie obrazów: 0.01 USD za obraz
- Przetwarzanie wideo: 0.10 USD za minutę
- Przetwarzanie audio: 0.05 USD za minutę
Użytkownicy ChatGPT Plus otrzymają dostęp do GPT-5 w ramach swojej subskrypcji (20 USD/miesiąc), choć z ograniczeniami dotyczącymi liczby zapytań multimodalnych.
Reakcje branży
Premiera GPT-5 wywołała falę komentarzy. Sundar Pichai z Google pogratulował OpenAI, jednocześnie zapowiadając, że "Google ma w zanadrzu własne niespodzianki na ten rok".
Elon Musk, który w przeszłości był współzałożycielem OpenAI, skrytykował brak otwartości firmy: "Nazywają się 'Open'AI, ale model jest własnością zamkniętą. xAI będzie inny."
Eksperci są zgodni, że GPT-5 to znaczący krok naprzód. "To nie jest inkrementalna aktualizacja" - komentuje Dr. Andrew Ng, pionier AI. "GPT-5 reprezentuje fundamentalną zmianę w sposobie myślenia o AI - od specjalistycznych narzędzi do prawdziwie uniwersalnych systemów."
Co to oznacza dla przyszłości?
Możliwości GPT-5 otwierają drzwi do aplikacji, które wcześniej były niemożliwe. Wyobraź sobie asystenta AI, który może uczestniczyć w wideokonferencjach, analizować prezentacje w czasie rzeczywistym i sugerować ulepszenia, wszystko podczas prowadzenia naturalnej konwersacji.
Lub system edukacyjny, który obserwuje ucznia rozwiązującego problem matematyczny na papierze, słucha jego wyjaśnień i dostarcza spersonalizowanej pomocy dostosowanej do jego stylu uczenia się.
Premiera GPT-5 to kamień milowy nie tylko dla OpenAI, ale dla całej branży AI. Przyszłość, w której asystenci AI rozumieją i komunikują się z nami w sposób prawdziwie naturalny i multimodalny, właśnie się rozpoczęła.