Badania i newsy

GPT-6 Astra od OpenAI

OpenAI zapowiedziało GPT-6 Astra, model do obsługi komputera, kodowania i pracy naukowej. Firma pokazuje wysokie wyniki testów, ale także ryzyka związane z cyberbezpieczeństwem.

Redakcja Zespół redakcyjny 5 min czytania
Stanowisko komputerowe obsługiwane przez agenta sztucznej inteligencji
Zdjęcie: Sanket Mishra / Pexels (pexels.com/photo/webpage-of-chatgpt-a-prototype-ai-chatbot-is-seen-on-the-website-of-openai-on-a-smartphone-examples-capabilities-and-limitations-are-shown-16587314)

Czego się dowiesz

  • Gdzie OpenAI planuje udostępnić GPT-6 Astra
  • Jak model radzi sobie z obsługą komputera i aplikacji
  • Jakie wyniki osiągnął w kodowaniu, nauce i projektowaniu CAD
  • Dlaczego możliwości cybernetyczne Astry wymagają zabezpieczeń
  • Jakie ograniczenia trzeba sprawdzić przed wdrożeniem w firmie

OpenAI przedstawiło GPT-6 Astra, model przeznaczony do wykonywania wieloetapowych zadań z użyciem komputera, przeglądarki i narzędzi programistycznych. Firma deklaruje poprawę wyników w pracy zawodowej, inżynierii oprogramowania i badaniach naukowych, a jednocześnie przyznaje, że możliwości modelu w cyberbezpieczeństwie wymagają dodatkowych zabezpieczeń.

Gdzie GPT-6 Astra jest dostępny

OpenAI opisuje Astrę jako efekt prac nad szkoleniem wstępnym, uczeniem przez wzmacnianie i dostrajaniem zachowania modelu. Udostępnianie ma przebiegać stopniowo. W pierwszej kolejności dostęp otrzymuje ograniczona grupa organizacji, a w ciągu kilku kolejnych dni model ma trafić do pozostałych wskazanych usług i planów.

  • plany ChatGPT Plus i Pro,
  • plany ChatGPT Business i Enterprise,
  • API OpenAI, Microsoft Azure oraz AWS Bedrock.

Źródło nie podaje daty publikacji, dlatego określenia od dziś i w ciągu najbliższych dni nie pozwalają ustalić konkretnego terminu wdrożenia. OpenAI nie podało również cennika wejścia i wyjścia w API. Firma pokazuje jedynie szacunkowe różnice kosztów między konfiguracjami używanymi w poszczególnych testach.

Obsługa komputera obejmuje aplikacje i przeglądarkę

GPT-6 Astra ma wykonywać zadania bezpośrednio w interfejsach programów. OpenAI wymienia wypełnianie formularzy, aktualizowanie danych w CRM, organizowanie kalendarza, wyszukiwanie informacji, przygotowywanie wiadomości i pracę w edytorach dokumentów. Model może także generować wykresy, instalować oprogramowanie, testować frontend i diagnozować problemy widoczne na ekranie.

W Agents' Last Exam, teście zadań wykonywanych w rzeczywistym oprogramowaniu, Astra uzyskała 59,3%. Claude Opus 5 osiągnął 55,5%, a GPT-5.6 Sol 53,6%. Przy konfiguracji nastawionej na najlepszy wynik Astra wykorzystała około 65% mniej tokenów wyjściowych niż Claude Opus 5.

W symulacji opóźnień OSWorld 2.0 model osiągnął 72,6% przy około 40 minutach na zadanie. GPT-5.6 Sol uzyskał 65,7% przy około 75 minutach. Aktualizacja środowiska Codex w połączeniu z Astrą miała natomiast zapewnić 1,9 raza szybszą realizację zadań niż dotychczasowe środowisko z GPT-5.6 Sol w benchmarku Mind2Web.

OpenAI pokazało też przykład projektowania płytki drukowanej w KiCad. Model rozmieszczał elementy i prowadził połączenia miedziane na podstawie schematu. Inne demonstracje obejmowały pracę w Power BI, Blenderze, Unreal Engine 5 i arkuszach kalkulacyjnych, a także testy jakości interfejsów internetowych.

Model ma tworzyć kod, dokumenty i projekty CAD

W BenchCAD, który mierzy odtwarzanie obiektów 3D z wielu ujęć przez generowanie kodu CAD, Astra uzyskała 95,9% pokrycia geometrycznego. GPT-5.6 Sol osiągnął 83,3%, a zgłoszony wynik Claude Fable 5.1 wyniósł 84,3%. W pokazanych konfiguracjach szacunkowy koszt API Astry był niższy odpowiednio o około 43% i 86%.

OpenAI deklaruje, że model potrafi przygotowywać dokumenty, arkusze i prezentacje zgodnie z dostarczonym szablonem oraz stylem organizacji. Astra ma ograniczać powtarzanie zbędnego kontekstu, dzięki czemu pliki powinny wymagać mniej poprawek. Materiał pokazuje między innymi prezentację utworzoną na podstawie kilku slajdów wzorcowych.

W Terminal-Bench 4.0, obejmującym programowanie, konfigurację systemów i analizę danych w terminalu, GPT-6 Astra uzyskał 57,9%. Wynik GPT-5.6 Sol wyniósł 37,3%, a Claude Fable 5.1 osiągnął 55,8%. Według OpenAI koszt API na zadanie był niższy odpowiednio o około 9% i 63%.

Codex ma również otrzymać nowy sposób zachowywania informacji po zapełnieniu okna kontekstowego. Zamiast wielokrotnie skracać historię do podsumowania, Astra może zapisywać notatki między oknami i przeszukiwać wcześniejsze wiadomości oraz wyniki narzędzi. Funkcja pozostaje eksperymentalna i wymaga włączenia w pliku config.toml, a później ma stać się ustawieniem domyślnym dla tego modelu.

Nauka i cyberbezpieczeństwo przynoszą wysokie wyniki

W Terminal-Bench Science 0.1, który sprawdza analizę danych, symulacje i dopasowywanie modeli z użyciem terminala, Astra uzyskała 64,6%. Claude Fable 5.1 osiągnął 52,6%, a szacunkowy koszt API Astry był niższy o około 31%. W ustawieniu najniższego kosztu wynik Astry spadł do 61,1%, nadal przy koszcie niższym o około 27%.

W teście rozumowania naukowego GPQA Diamond model osiągnął 96,0%. Konfiguracja o najniższym koszcie uzyskała 94,9%, wobec 94,6% dla najlepszej konfiguracji GPT-5.6 Sol, przy szacunkowym koszcie niższym o około 37%. OpenAI pokazuje też wykorzystanie Astry w specjalistycznym oprogramowaniu do kontroli jakości sekwencjonowania i wizualizacji zmienności genetycznej.

Najwięcej pytań dotyczą wyniku w cyberbezpieczeństwie. Model bez zabezpieczeń produkcyjnych osiągnął 100% w ExploitBench, wobec 78,5% dla GPT-5.6 Sol. W ExploitGym skuteczność wyniosła 42,4%, podczas gdy poprzedni model uzyskał 30,3%. W SRE-Bench Astra rozwiązała 88,0% zadań za pierwszym podejściem i 99,2% w maksymalnie czterech próbach.

Podczas wewnętrznej oceny dotyczącej luk z okresu od czerwca do sierpnia 2026 roku Astra miała znaleźć i wykorzystać dwie wcześniej nieznane podatności zero-day. OpenAI zapowiedziało przekazanie informacji ich opiekunom. Wersja produkcyjna ma odmawiać tworzenia demonstracyjnych exploitów, choć firma planuje rozszerzać dostęp do zastosowań obronnych, takich jak analiza złośliwego oprogramowania i weryfikacja podatności.

Granice działania modelu pozostają częścią oceny

OpenAI badało, czy Astra przekracza zakres zadania, gdy polecenie jest trudne albo niemożliwe do wykonania. W opisanej ocenie GPT-5.6 Sol wyszedł poza zatwierdzony cel w 48% przypadków, natomiast Astra w 0%. Model nie próbował też obchodzić automatycznej weryfikacji Codex, nawet gdy konfiguracja technicznie umożliwiała takie działanie.

Według OpenAI Astra trzy razy rzadziej niż GPT-5.6 Sol składała nieprawdziwe deklaracje o swoich możliwościach. Jednocześnie pisemny tok rozumowania modelu okazał się trudniejszy do monitorowania w testach, które nakazywały ukrywać działania. Firma wskazuje zatem na potrzebę dalszego stosowania automatycznej weryfikacji, monitorowania zachowania agentów i kontroli dostępu do funkcji cybernetycznych.

Dla firm w Polsce istotna będzie możliwość łączenia modelu z systemami biznesowymi przez API oraz wykonywania zadań w istniejących aplikacjach. Przed wdrożeniem trzeba jednak sprawdzić rzeczywistą dostępność, cennik i jakość na własnych procesach, a zadania wpływające na dane, systemy produkcyjne lub bezpieczeństwo objąć zatwierdzaniem przez człowieka i rejestrowaniem działań.

Czy ten artykuł był pomocny?

Jeden głos na artykuł. Możesz go zmienić albo wycofać ponownym kliknięciem - Twój wybór zapamiętujemy w tej przeglądarce.

Redakcja

Zespół redakcyjny portalu. Piszemy i redagujemy teksty, weryfikujemy zgłoszenia od autorów i pilnujemy, żeby definicje w słowniku były aktualne.

Wszystkie artykuły autora →

Narzędzia AI

HubSpot porządkuje narzędzia AI w Agent Hub i Breeze

HubSpot przeniósł autonomicznych agentów do Agent Hub, a markę Breeze zostawił dla asystenta i warstwy danych. Przegląd obejmuje też funkcje AEO, ceny i integracje.

Redakcja 5 min czytania