Agenci AI

Google udostępnia Mantis do audytów kodu z agentami AI

Google otworzył kod Mantis, modułowego zestawu umiejętności, który prowadzi agenta od wykrycia luki po test poprawki. Narzędzie służy obecnie do ocen lokalnych i wewnętrznych, nie do produkcji.

Redakcja Zespół redakcyjny 5 min czytania
Programista analizujący kod pod kątem podatności bezpieczeństwa
Zdjęcie: AS Photography / Pexels (pexels.com/photo/black-samsung-tablet-display-google-browser-on-screen-218717)

Czego się dowiesz

  • Czym Mantis różni się od samodzielnego skanera kodu
  • Jak agent przechodzi od modelu zagrożeń do poprawki i raportu
  • W jaki sposób sandbox i ponowny atak potwierdzają skuteczność naprawy
  • Z jakimi agentami można uruchomić Mantis i jakie ma ograniczenia

Google udostępnił jako open source Mantis, zestaw umiejętności, dzięki którym agent kodujący może przeprowadzić cały cykl analizy podatności. Toolkit wykrywa podejrzany błąd, odrzuca fałszywe alarmy, odtwarza problem w izolowanym środowisku, przygotowuje poprawkę i ponawia atak, aby ocenić ryzyko pozostałe po zmianie. Według publikacji z 9 września 2026 r. Mantis nadaje się do lokalnych i wewnętrznych testów, ale Google nie zaleca jeszcze używania go w środowisku produkcyjnym.

Czym Mantis różni się od skanera bezpieczeństwa

Mantis nie jest samodzielnym skanerem, który uruchamia się dla repozytorium i pozostawia bez nadzoru. To niezależny od stosu technologicznego zestaw umiejętności ładowanych przez używanego już agenta kodującego. Poszczególne funkcje wywołuje się jako polecenia poprzedzone ukośnikiem.

Każdy etap działa jako osobny katalog umiejętności. Zespół może uruchamiać polecenia pojedynczo albo połączyć je w sekwencję. Nadrzędna umiejętność /mantis-meta-agent steruje całym procesem podczas jednej długotrwałej sesji.

Mantis publikuje także kontrakty między etapami. Pozwala to zespołom opakować umiejętności w deterministyczny mechanizm wykonawczy, zamiast pozostawiać modelowi językowemu swobodne planowanie i uruchamianie poleceń powłoki. Ograniczenia dotyczą również miejsc, w których agent może wykonywać kod.

Jak przebiega analiza podatności od rozpoznania do raportu

Proces rozpoczyna się od poznania badanego projektu, a kończy raportem przeznaczonym dla człowieka. Mantis dzieli ten przepływ na wyspecjalizowane polecenia:

  • /mantis-history analizuje historię systemu kontroli wersji pod kątem wcześniejszych poprawek bezpieczeństwa. /mantis-summarize tworzy mapy katalogów, /mantis-architecture buduje bazę wiedzy w formacie Markdown, a /mantis-threat-model wyznacza granice zaufania. Następnie /mantis-plan opracowuje ukierunkowany plan przeglądu.
  • /mantis-researcher przeszukuje pliki zgodnie z planem. Polecenia /mantis-dedupe, /mantis-review i /mantis-critic łączą duplikaty, stosują reguły wykluczające i usuwają problemy, które nie mogą wystąpić w wersji przeznaczonej do wydania.
  • /mantis-reproduce uruchamia ładunki testowe w gVisor albo maszynie wirtualnej z wyłączoną siecią. /mantis-chain składa wieloetapowe łańcuchy wykorzystania podatności z wcześniej potwierdzonych ustaleń.
  • /mantis-patch wprowadza i weryfikuje poprawkę. /mantis-calibrate przypisuje ryzyku ocenę od 1 do 10, /mantis-reflect zapisuje wnioski dla kolejnego przebiegu, a /mantis-report przygotowuje pakiet wyników dla zespołu.
  • /mantis-advise odwraca typową kolejność pracy. Przed napisaniem kodu odpytuje zgromadzony model zagrożeń, historię powiązanych błędów oraz zweryfikowane wzorce poprawek.

Polecenie /mantis-advise ma ograniczyć powroty tej samej klasy błędu. Agent nie czeka wtedy na zakończenie implementacji, lecz korzysta z wiedzy zgromadzonej podczas wcześniejszych audytów i napraw.

Wstępne etapy tworzą kontekst potrzebny do bardziej ukierunkowanej analizy. Według Google hierarchiczne drzewo podsumowań zmniejsza narzut związany z tokenami o ponad 85 proc. Materiał źródłowy nie podaje jednak metodologii tego pomiaru ani projektów wykorzystanych do porównania.

Jak toolkit ogranicza fałszywe alarmy

Google wskazuje, że proste skanowanie kodu przez AI może osiągać odsetek trafnych wykryć poniżej 7 proc. Mantis ma rozwiązywać ten problem przez wieloetapowe filtrowanie wyników, a nie przez przyjmowanie oceny modelu jako dowodu istnienia podatności.

Po wstępnym przeszukaniu plików narzędzie usuwa powtarzające się zgłoszenia i stosuje reguły negatywne, które wykluczają nieprawidłowe przypadki. Odrzuca również ustalenia odnoszące się do kodu lub konfiguracji, których nie ma w wydaniu trafiającym do użytkowników.

Dopiero wynik, który przejdzie te etapy, może trafić do kontrolowanego odtworzenia. Źródło nie opisuje zbioru testowego, na którym wyznaczono poziom poniżej 7 proc., ani nie podaje porównania skuteczności Mantis z konkretnymi skanerami. Liczby te należy więc traktować jako dane przytoczone przez Google, a nie pełny benchmark.

Dlaczego odtworzenie błędu i ponowny atak są kluczowe

Najważniejszą granicą zaufania w Mantis nie jest pewność deklarowana przez model, lecz wynik kontrolowanej próby. Polecenie /mantis-reproduce wykonuje ładunek w gVisor albo maszynie wirtualnej. Środowisko ma wyłączoną sieć, co ogranicza agentowi możliwość komunikacji z systemami zewnętrznymi podczas testu.

Potwierdzone podatności mogą zostać połączone przez /mantis-chain. Dzięki temu proces obejmuje również scenariusze, w których pojedyncze błędy tworzą dopiero razem wieloetapowy łańcuch ataku. Mantis nie powinien budować takiego scenariusza z ustaleń, których wcześniej nie udało się odtworzyć.

Po potwierdzeniu problemu /mantis-patch przygotowuje minimalną poprawkę i sprawdza jej działanie. Agent ponownie wykonuje atak na zmieniony kod. Jeżeli próba nadal się udaje albo poprawka pozostawia inne ryzyko, rezultat powinien znaleźć odzwierciedlenie w ocenie przygotowanej przez /mantis-calibrate.

Skala oceny obejmuje wartości od 1 do 10. Źródło nie opisuje szczegółowych kryteriów poszczególnych poziomów. Końcowy raport zbiera ustalenia w formie przeznaczonej dla człowieka, natomiast /mantis-reflect przekazuje wnioski do następnego przebiegu analizy.

Gdzie można obecnie uruchomić Mantis

Kod Mantis jest dostępny w repozytorium google/mantis na licencji Apache 2.0. Według publikacji toolkit można uruchomić z Gemini CLI, Antigravity CLI, Google ADK albo porównywalnym środowiskiem agentowym. Konstrukcja niezależna od stosu technologicznego ma umożliwiać podłączanie umiejętności do różnych agentów kodujących.

Google określa Mantis jako modułowy toolkit, a nie wspierany produkt firmy. Oznacza to brak deklaracji gotowości produkcyjnej i formalnego wsparcia opisanego w materiale. Nie podano również terminu, w którym takie wdrożenia miałyby stać się zalecane.

Na obecnym etapie narzędzie jest przeznaczone do lokalnej oceny oraz testów wewnętrznych. Zespół może sklonować repozytorium, uruchomić wybrane umiejętności i sprawdzić cały proces, zachowując ograniczenia dotyczące wykonywania kodu oraz izolacji środowiska.

Dla firm w Polsce oznacza to możliwość przeprowadzenia kontrolowanego pilotażu bez traktowania Mantis jako zamiennika produkcyjnego procesu bezpieczeństwa. Zespoły IT powinny oceniać przede wszystkim jakość reprodukcji, skuteczność filtrowania fałszywych alarmów i zachowanie agenta podczas wykonywania kodu w sandboxie.

Czy ten artykuł był pomocny?

Jeden głos na artykuł. Możesz go zmienić albo wycofać ponownym kliknięciem - Twój wybór zapamiętujemy w tej przeglądarce.

Redakcja

Zespół redakcyjny portalu. Piszemy i redagujemy teksty, weryfikujemy zgłoszenia od autorów i pilnujemy, żeby definicje w słowniku były aktualne.

Wszystkie artykuły autora →

Narzędzia AI

HubSpot porządkuje narzędzia AI w Agent Hub i Breeze

HubSpot przeniósł autonomicznych agentów do Agent Hub, a markę Breeze zostawił dla asystenta i warstwy danych. Przegląd obejmuje też funkcje AEO, ceny i integracje.

Redakcja 5 min czytania
Agenci AI

OpenAI wstrzymuje trening modeli po awarii zabezpieczeń

Firma zawiesiła trening, ewaluacje i pracę najbardziej zaawansowanych modeli z narzędziami. Decyzję podjęła po niedozwolonym połączeniu zewnętrznym i awarii automatycznego zatrzymania.