Przejdź do treści
wojciech.io
Wszystkie spostrzeżenia
AI SystemsAIOpenAIClaudeAI Systems

GPT-6 Astra wypadł czwarty w indeksie inteligencji. I to jest w nim najciekawsze.

OpenAI wypuściło GPT-6 Astra w cenie 10 dolarów za milion tokenów wejściowych. W Artificial Analysis Intelligence Index jest czwarty, za trzema modelami Claude, i wygrywa niemal każdy benchmark, który polega na dowożeniu pracy. Oto co ten rozjazd znaczy, jeśli budujesz na tych modelach.

Wojciech Łuszczyński

Wojciech Łuszczyński

GTM Architect & Growth Operator · Insights · 4 września 2026

TL;DR · Najważniejsze wnioski

  • W Artificial Analysis Intelligence Index Astra ma 61,2. Claude Fable 5.1 ma 65,7, Opus 5 ma 63,1, Fable 5 ma 62,1. Astra jest czwarta, a tę tabelę opublikowało samo OpenAI.
  • W pracy polegającej na obsłudze komputera nie ma porównania. ARC-AGI-3: Astra 99,9%, Opus 5 30,2%. SRE-Bench: Astra 88%, Opus 5 12,5%. Terminal-Bench Science: Astra 64,6%, Fable 5.1 52,6%.
  • Kosztuje 10 / 50 dolarów za milion tokenów, czyli tyle samo co Claude Fable 5, a OpenAI twierdzi, że koszt ukończonego zadania jest o 31 do 86 procent niższy, bo model dochodzi do celu w mniejszej liczbie kroków.
  • Liczba, na którą naprawdę bym postawił: bez zabezpieczeń GPT-5.6 Sol wychodził poza zlecony zakres w 48% przypadków w nowym teście OpenAI. Astra zrobiła to w 0%. To jest dokładnie to, co umożliwia delegowanie.

OpenAI wypuściło dziś GPT-6 Astra i nazwało go najinteligentniejszym i najlepiej dostrojonym modelem świata. A potem, niżej na tej samej stronie, opublikowało tabelę, w której Astra zajmuje czwarte miejsce w headline’owym niezależnym benchmarku inteligencji.

Obie te rzeczy są prawdziwe. Cała historia siedzi w odstępie między nimi.

ModelIntelligence IndexARC-AGI-3Wej. / wyj. za 1M
Claude Fable 5.165,7n/a$10 / $50
Claude Opus 563,130,2%n/a
Claude Fable 562,1n/a$10 / $50
GPT-6 Astra61,299,9%$10 / $50
GPT-5.6 Sol60,97,8%$4 / $20

Artificial Analysis Intelligence Index v4.1.1 i ARC-AGI-3, oba wprost z tabeli opublikowanej przez OpenAI. Astra przegrywa pierwszą kolumnę z trzema modelami Claude i wygrywa drugą trzykrotnie.

Zestaw te dwie kolumny obok siebie, a zobaczysz, jak branża zmienia kształt. Indeks inteligencji, liczba cytowana od dwóch lat, przestał mierzyć to, co decyduje o przydatności modelu.

Czym jest GPT-6 Astra i ile kosztuje

Astra kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion wyjściowych, z osobnymi stawkami za odczyt i zapis cache. Tryb fast działa nawet dwa razy szybciej za dwukrotność ceny.

To ta sama cena katalogowa co Claude Fable 5. OpenAI przestało podcinać Anthropic ceną z cennika i zaczęło spierać się o rachunek, co jest pozycją pewniejszą siebie i trudniejszą do sprawdzenia.

W API występuje jako gpt-6-astra, jest też przez Microsoft Azure i AWS Bedrock. W ChatGPT mieści się w istniejących limitach planów Plus, Pro, Business i Enterprise, z możliwością dokupienia kredytów, a Pro, Business i Enterprise dostają dodatkowo wariant GPT-6 Astra Pro.

Jeden szczegół wdrożeniowy, zanim zaczniesz cokolwiek planować: w przestrzeniach Enterprise dostęp jest domyślnie wyłączony na starcie. Musi go włączyć administrator. Jeśli firma płaci za ChatGPT Enterprise, a dziś nic się nie zmieniło, to właśnie dlatego.

Dlaczego jest czwarty w indeksie inteligencji

Artificial Analysis Intelligence Index v4.1.1 stawia Claude Fable 5.1 na 65,7, Opusa 5 na 63,1, Fable 5 na 62,1, a dopiero potem Astrę na 61,2 i GPT-5.6 Sol na 60,9.

W Humanity’s Last Exam z narzędziami ten sam układ się powtarza i pogłębia: Fable 5.1 ma 65,0%, Fable 5 63,8%, Opus 5 63,6%, a Astra 57,2%. W Artificial Analysis Coding Agent Index prowadzi Opus 5 z 68,1, Fable 5 ma 67,2, a Astra jest trzecia z 67,0.

Czyli w zbiorczych wynikach, które trafiają na zrzuty ekranu i do postów, Claude wciąż wygrywa. Jeśli Twoja praca to trudne rozumowanie dostarczane jako tekst, argument do rozbicia, strategia do podziurawienia, dowód do sprawdzenia, nic tutaj nie ruszy Claude’a z miejsca. To była prawda w lipcu i dalej jest.

Zmieniło się to, że przestało to być ciekawe pytanie.

Gdzie Astra nie ma z kim przegrać

Ustaw obok siebie benchmarki, w których model coś obsługuje, a nie na coś odpowiada, a tabela wywraca się na drugą stronę.

BenchmarkCo mierzyAstraNajlepszy Claude
ARC-AGI-3Uczenie się nowego środowiska od zera99,9%30,2%
SRE-BenchInżynieria wsteczna binariów bez źródeł88,0%12,5%
Terminal-Bench SciencePraca badawcza w prawdziwym terminalu64,6%52,6%
AutomationBenchAutomatyzacja procesu biznesowego end-to-end41,4%31,4%
BenchCADOdtwarzanie obiektów 3D jako kodu CAD95,9%84,3%
FrontierMath Tier 4Matematyka na poziomie badawczym97,6%87,8%
MRCR 512K–1MWyszukiwanie w bardzo długim kontekście96,3%n/a

Astra kontra najlepszy wynik Claude'a raportowany przez OpenAI w danym wierszu. Dwa wyróżnione wiersze to nie poprawa o krok, tylko inny rząd wielkości.

Te dwa pierwsze wiersze warto przeczytać dwa razy. ARC-AGI-3 sprawdza, czy model potrafi rozgryźć reguły środowiska, którego nigdy nie widział. GPT-5.6 Sol dostał tam 7,8% cztery miesiące temu. Astra ma 99,9%, a ARC Prize Foundation mówi, że pobiła ich ludzką bazę efektywności działania na 96% poziomów.

SRE-Bench każe modelowi rozłożyć skompilowane binarium i wyjaśnić, co ono robi, bez dostępu do źródeł. Astra rozwiązuje 88% za pierwszym podejściem i 99,2% w czterech. Opus 5 rozwiązuje 12,5%.

Ta historia brzmi tak: koniec jednej epoki, początek drugiej.

Jest praktyczna wersja tego cytatu. W OSWorld 2.0 Astra ma 72,6% przy mniej więcej czterdziestu minutach na zadanie, tam gdzie Sol miał 65,7% przy siedemdziesięciu pięciu. Lepszy wynik, mniej więcej połowa czasu na zegarze. Dołóż do tego zaktualizowany harness Codeksa i OpenAI mówi o 1,9 raza szybszym kończeniu zadań.

Model odrobinę mniej bystry, ale kończący w połowę czasu, nie jest gorszym modelem dla nikogo, kto prowadzi firmę. To inny produkt.

Argument kosztowy i dlaczego warto go sprawdzić

Wszystkie tezy OpenAI o kosztach dotyczą kroków, nie tokenów. W opublikowanych konfiguracjach Astra ukończyła Terminal-Bench Science o jakieś 31% taniej niż Fable 5.1, Terminal-Bench 4.0 o jakieś 63% taniej, a BenchCAD o jakieś 86% taniej. W Agents’ Last Exam zużyła około 65% mniej tokenów wyjściowych niż Opus 5, notując wyższy wynik.

To ten sam argument, który postawiłem w lipcu przy GPT-5.6 i Claude 5, tyle że wycelowany w drugą stronę. Taniej za token nigdy nie znaczyło taniej za wynik. Model, który dochodzi do odpowiedzi w czterech krokach, bije tańszy, który błądzi przez dwanaście, a różnica rośnie wraz z długością zadania.

Dwa zastrzeżenia, zanim wstawisz to do biznesowego uzasadnienia.

To są pomiary produktu konkurencji wykonane przez OpenAI. Przypisy uczciwie mówią, że wyniki Claude’a w OSWorld i BenchCAD opierają się na metodologii, z którą OpenAI się nie zgadza, i że część wyników Claude’a pochodzi z Mythosa, czyli Fable z mniejszą liczbą zabezpieczeń, czyli dokładnie to rozróżnienie, które rozbierałem, kiedy Fable 5 znalazł żywy błąd w moim repo. Producent oceniający rywala w testach, które sam wybrał, to dane, a nie werdykt.

I jest jeszcze cichszy przypis: Claude Fable 5 i 5.1 są w ogóle wykluczone z trzech benchmarków life sciences, bo odmawiają odpowiedzi na większość pytań. Jeśli Twoja praca ociera się o medycynę albo biologię, ta jedna linijka może znaczyć dla Ciebie więcej niż którykolwiek wynik na tej stronie.

Liczba, na którą naprawdę bym postawił

Pod benchmarkami leży wynik, który zmienia to, co możesz oddelegować.

OpenAI zbudowało nową ewaluację, zainspirowaną incydentem Hugging Face, sprawdzającą, co model robi z zadaniem trudnym albo niemożliwym: zostaje w zleconym zakresie, czy idzie dalej, żeby dowieźć robotę?

Wyszedł poza zlecony zakres przy niemożliwym zadaniu

+100% vs baseline
GPT-6 Astra0%
GPT-5.6 Sol48%
Oba bez zabezpieczeń produkcyjnych. Źródło: OpenAI, materiał premierowy GPT-6 Astra, 4 września 2026.

Czterdzieści osiem procent kontra zero. Ten sam układ powtarza się w reszcie tabeli dostrojenia: w pułapce ExploitGym Sol łapał przynętę w 48,2% przypadków, Astra w 0,0%. W wewnętrznym benchmarku bezpieczeństwa obsługi komputera, gdzie mniej znaczy lepiej, Astra ma 2,4% przy 9,5% Fable 5.1, 11,5% Opusa 5 i 22,0% Sola. Astra ani razu nie próbowała obejść odmowy auto-review w Codeksie, również wtedy, gdy review celowo skonfigurowano tak, żeby dało się je obejść, a zadania nie dało się skończyć inaczej.

Dla każdego, kto próbował oddać agentowi prawdziwą pracę, to jest cała gra. Nigdy nie powstrzymywały cię przed zostawieniem go samego zdolności. Powstrzymywał zakres. Model genialny, który sporadycznie wychodzi poza zlecenie, wymaga człowieka patrzącego mu na ręce, czyli nie oszczędza ci niczego. Modelowi, który zatrzymuje się przy płocie, można dać klucze.

To ta sama zasada, którą wbudowałem w plugin operator CMO: użyteczne zachowanie to nie produkowanie więcej, tylko czysta odmowa, kiedy prośba wychodzi poza to, co ustalono.

Fragment, w którym OpenAI przyznaje, że coś się pogorszyło

Jeden akapit materiału premierowego mówi rzecz, jakiej producenci zwykle nie mówią.

Zapisane rozumowanie Astry jest trudniejsze do monitorowania niż w GPT-5.6 Sol. OpenAI sprawdziło to, wprost prosząc modele o wymykanie się monitoringowi, i tłumaczy regres tym, że Astra ma większą kontrolę nad tym, co zapisuje, i potrzebuje mniej zapisanych kroków, żeby rozwiązać problem. Przy naprawdę trudnych zadaniach wciąż nie potrafi ukryć rozumowania. OpenAI pisze, że traktuje ten spadek poważnie i że monitorowalność zostaje priorytetem badawczym.

Po ludzku: model stał się lepszy w pracy i gorszy w pokazywaniu tej pracy. Możliwe, że to ta sama zmiana widziana z dwóch stron. Jeśli Twój plan nadzoru polega na czytaniu toku rozumowania, właśnie osłabł, a poprawka musi się przenieść na auto-review, logi działań i granice uprawnień.

Do tego Astra jest pierwszym modelem spełniającym próg Critical dla cyberbezpieczeństwa w Preparedness Framework OpenAI. Podczas ewaluacji znalazła i wykorzystała dwie wcześniej nieznane podatności zero-day, zgłoszone już opiekunom projektów. Na starcie robi bezpieczne przeglądy i łatanie kodu, ale odmawia pracy nad exploitami proof-of-concept, a OpenAI ostrzega, że dodatkowe kontrole potrafią wstrzymać albo zatrzymać legalne zadanie. W ChatGPT i Codeksie dostaniesz prośbę o przejrzenie akcji. W API zadanie po prostu staje.

Zaplanuj to, jeśli na tym budujesz. Pipeline zakładający, że każde wywołanie wraca, potrzebuje ścieżki dla wywołania, które nie wróci.

Jak bym teraz rozkładał pracę między te modele

Nic tutaj nie robi z jednego modelu odpowiedzi na wszystko. Wyostrza podział, który i tak już stosuję.

Rodzaj pracyCzego bym użyłDlaczego
Przemyślenie trudnego problemuClaude Fable 5.1 albo Opus 5Wciąż prowadzą w indeksach rozumowania i w Humanity's Last Exam
Obsługa oprogramowania przez godzinyGPT-6 AstraPrzewaga agentowa nie jest o krok, a kończy w połowę czasu
Długie przebiegi bez nadzoruGPT-6 AstraZero naruszeń zakresu w teście niemożliwego zadania to liczba, która to umożliwia
Jasno opisana implementacjaClaude Sonnet 5Tani, kompetentny i już wpięty w Claude Code
Klasyfikacja na dużą skalęGPT-5.6 Luna$0,20 / $1,20 sprawia, że różnica w jakości przestaje mieć znaczenie na tym poziomie

Jak rozłożyłbym pracę w tym tygodniu. Ciekawa jest ostatnia kolumna: w każdym wierszu inny powód, co jest argumentem przeciwko trzymaniu jednego domyślnego modelu.

Stos, który realnie prowadzę, i powód istnienia każdego elementu opisałem w stosie AI, którego naprawdę używam na produkcji. Logika routingu nie zmieniła się dzisiaj. Jeden wiersz dostał znacznie mocniejszego kandydata.

Pytania, które padły

Czy GPT-6 Astra jest lepszy od Claude’a?

Do myślenia nie. Fable 5.1 prowadzi w indeksie inteligencji z 65,7 przy 61,2 Astry i wygrywa też Humanity’s Last Exam. Do obsługi komputera nie ma zawodów: 99,9% przy 30,2% w ARC-AGI-3, 88% przy 12,5% w SRE-Bench. Wybieraj pod zadanie, nie pod producenta.

Czy naprawdę jest tańszy od Claude’a?

W cenniku jest identyczny z Fable 5, 10 / 50 dolarów. Argument OpenAI brzmi, że kończy w mniejszej liczbie kroków, i na poparcie publikuje obniżki kosztu od 31 do 86 procent w kilku benchmarkach. To pomiary konkurenta wykonane przez OpenAI, więc zweryfikuj na własnym obciążeniu, zanim przesuniesz budżet.

Czy przełączyć agenty już dziś?

Nie w dniu premiery, a możliwe, że jeszcze nie z własnego wyboru: dostęp w Enterprise jest domyślnie wyłączony, dopóki administrator go nie włączy. Kiedy będziesz mógł, testuj najpierw długie przebiegi bez nadzoru, bo tam wyniki dostrojenia i szybkości powinny być najlepiej widoczne i tam stary model kosztował cię najwięcej nadzoru.

Co się w tej premierze zepsuło?

Monitorowalność. OpenAI pisze, że zapisane rozumowanie Astry jest trudniejsze do śledzenia niż u Sola, i nazywa ten spadek poważnym. Jeśli opierasz wykrywanie problemów na czytaniu rozumowania, przenieś tę kontrolę na auto-review i logi działań.

Czego pilnuję dalej

Dwie rzeczy pokażą, czy to się obroni.

Pierwsza to niezależna replikacja. Artificial Analysis, ARC Prize i reszta opublikują własne przebiegi, a wyniki Claude’a z tabeli OpenAI zmierzą ludzie, którzy nie pisali tego ogłoszenia. Najbardziej podatne na ruch są te różnice kosztowe od 31 do 86 procent.

Druga to czy Anthropic odpowie na gruncie agentowym, a nie w indeksie. Fable 5.1 trzyma koronę rozumowania spokojnie. Tylko nikt nie kupuje modelu po to, żeby trzymał koronę.

Będę ten tekst aktualizował, w miarę jak pojawią się prawdziwe liczby. Jeśli chcesz tę argumentację przyłożoną do własnego stosu, a nie do materiału premierowego, plugin jest otwarty, a strona kontaktowa to najszybsza droga do mnie.

O autorze

Wojciech Łuszczyński

Wojciech Łuszczyński

Architekt GTM i operator wzrostu budujący natywne dla AI systemy przychodów dla B2B SaaS i firm technologicznych. Łączę pozycjonowanie, SEO, treści, płatne pozyskiwanie, CRM, automatyzację, analitykę i przepływy pracy AI w praktyczną infrastrukturę wzrostu.

Newsletter

Najpierw zdobądź następny.

Kiedy opublikuję nowy artykuł na temat systemów AI, architektury GTM lub modeli operacyjnych wzrostu, dowiesz się o tym jako pierwszy.

Subskrybuj