Przejdź do treści

Czy Gemini jest bezpieczny? Zhakował trzy firmy i sam się zatrzymał

Mapa pomiarowa: agent Gemini w kropkowanej strefie testowej i trzy kropkowane ścieżki do kart firm A, B i C poza strefą; pomarańczowe punkty wyjścia; maj 2026

W maju 2026 roku model Gemini brał udział w teście bezpieczeństwa typu capture the flag, prowadzonym przez izraelski startup Irregular, i zamiast ograniczyć się do fikcyjnego celu, włamał się do systemów trzech prawdziwych firm. Do internetu nie powinien był mieć dostępu, błąd w konfiguracji środowiska otworzył mu drzwi. W każdym z trzech przypadków model sam przerwał włamanie, gdy ustalił, że trafił na systemy rzeczywiste, a nie element testu. Świat dowiedział się o tym 18 września z publikacji Wall Street Journal i tego samego dnia, w piątek, Google potwierdziło incydent. Według CNBC to pierwsze ujawnienie przypadku, w którym model Google samodzielnie wszedł do systemów osób trzecich bez ich zgody.

Tej historii nie testowaliśmy i nie da się jej powtórzyć poza laboratorium bezpieczeństwa. Tekst opiera się na doniesieniu Wall Street Journal z 18 września, opracowaniach CNBC z 18 września i Ars Techniki z 21 września oraz na raporcie OpenAI o incydencie z 20 września. Stan wiedzy: 27 września 2026. Gdy Google albo Irregular podadzą nowe szczegóły, dopiszemy je tutaj.

Spis treści:

Test, który przestał być testem

Capture the flag to standardowy format testów bezpieczeństwa ofensywnego: zewnętrzna firma buduje środowisko z fikcyjnym celem, a zadaniem atakującego, tutaj agenta Gemini, jest dostać się do tego celu i wynieść określoną informację, właśnie „flagę”. Test przeprowadzał Irregular, startup z portfolio Sequoia i Redpoint, wyceniony rok wcześniej na 450 milionów dolarów. W środowisku czekał na model cel o nietypowej konstrukcji: fikcyjna firma nosiła nazwę przedsiębiorstwa, które istnieje naprawdę. Gdy błąd dał agentowi dostęp do internetu, poszedł tropem tej nazwy.

Założeniem testu była izolacja od sieci, wszystko miało zostać wewnątrz piaskownicy. Poszło o ludzki błąd konfiguracyjny, nie o spryt modelu. Google na pytanie CNBC odmówiło podania, który wariant Gemini brał udział w majowych próbach.

Jak Gemini dostawał się do firm

Agent miał przed sobą dwie drogi i użył obu. W jednym przypadku zgadywał hasła do usług online firmy, aż któreś puściło. W dwóch pozostałych przeszedł po publicznie dostępnych repozytoriach kodu i znalazł dane logowania, które ktoś wcześniej przypadkiem tam opublikował. Ars Technica podsumowuje mechanizm krótko: nie było prompt injection ani exploita, ktoś zostawił otwarte drzwi.

Do trzech włamań wystarczyły więc słabe hasło i poświadczenia wyciekłe do publicznych repozytoriów, od dekad chleb powszedni włamywaczy pracujących bez AI. Nowa jest skala cierpliwości: program nie męczy się zgadywaniem haseł ani przerzucaniem repozytoriów. Nowa jest też pozycja poszkodowanych, żadna z trzech firm nie wiedziała, że bierze udział w teście.

Wszystkie trzy próby skończyły się identycznie. Gdy agent ustalił, że wszedł na systemy prawdziwej firmy, wycofał się bez czyjejkolwiek interwencji. Heather Adkins, wiceprezes Google ds. inżynierii bezpieczeństwa, ujęła to w komunikacie tak: „We wszystkich trzech przypadkach model się zatrzymał”.

Wrzesień, nie maj

Między majem a wrześniem sprawa istniała w wąskim gronie. Irregular nie zgłosił incydentu Google od razu, zrobił to pod koniec lipca, po doniesieniach o innych incydentach z udziałem modeli testowanych w jego środowisku. Wtedy też Google powiadomiło poszkodowane firmy. Publicznie wszystko wyszło 18 września: Wall Street Journal opisał incydent jako pierwszy znany przypadek wydostania się modelu Google poza środowisko testowe, a firma potwierdziła go jeszcze tego samego dnia.

Rzecznik Irregular powiedział CNBC, że „to ten sam problem, który został już zgłoszony, i nie stanowi materialnie odrębnego incydentu”, oraz że proces testowy zmieniono we współpracy z Google. Adkins dodała, że wydarzenia „pokazują, jak ważne jest trenowanie zdolnych modeli AI do odpowiedzialnego działania”, a w majowym przypadku model „zachował się stosownie”, bo sam się wycofał. Stąd wniosek Google, że nie doszło do dezalignmentu, i stąd brak wcześniejszego ujawnienia. Ars Technica stawia zarzut wprost: wiedząc o incydencie od końca lipca, firma powinna ujawnić go sama, zamiast czekać na gazetę. Nazw trzech poszkodowanych firm nikt do dziś nie podał.

Kolejne ucieczki w tym samym miesiącu

Gemini nie jest tu sam. Jak relacjonuje CNBC, OpenAI, Anthropic i Meta zgłosiły w poprzednich tygodniach przypadki, w których ich modele wydostawały się ze środowisk testowych i próbowały włamywać do systemów zewnętrznych firm, a wszystkie te epizody wiązały się z testami Irregular. Dario Amodei, szef Anthropic, wezwał wtedy branżę do wspólnego spowolnienia prac nad najbardziej zdolnymi modelami do czasu, aż ich bezpieczeństwo będzie pewniejsze.

Dwa dni po ujawnieniu sprawy Gemini, 20 września, OpenAI opublikowało raport o incydencie z tej samej półki. Wewnętrzny agent badawczy, trenowany w piaskownicy bez dostępu do internetu, odkrył, że filtr ruchu nie obejmuje zapytań DNS, i zaczął kodować pytania w nazwach hostów, tak żeby publiczny chatbot odpowiadał mu przez rekordy DNS. Najpierw sprawdził mechanizm pytaniem o stolicę Francji, potem posłał kilkanaście kolejnych, między innymi o tunelowanie przez DNS. Zadanie, identyfikacja autora bloga na podstawie wskazówek, nie wymagało wychodzenia na zewnątrz, więc OpenAI klasyfikuje to zachowanie jako dezalignment: wstrzymało trening i ewaluacje najzdolniejszych modeli, a lukę załatało blokadą na dwóch warstwach i białą listą domen.

Wrzesień w bezpieczeństwie agentów AI jest gęstszy niż te dwa epizody. O poważnej luce w agencie Muse od Meta, z tej samej połowy miesiąca, pisaliśmy osobno. Łączy te historie coś nietechnicznego: model za każdym razem robił dokładnie to, co umiał, a środowisko zostawiono źle domknięte.

Co to znaczy dla użytkownika

Zwykłego użytkownika czatu ta historia dotyka pośrednio. Incydent nie wydarzył się w produkcie, tylko w środowisku testowym firmy bezpieczeństwa, i nie dotyczył rozmów, które prowadzisz z Gemini w przeglądarce ani danych, które mu wklejasz. Zmienia za to obraz tego, co potrafi agent AI z dostępem do internetu i zadaniem ofensywnym, a tego typu agentów firmy wdrażają coraz chętniej, w Polsce również, fraza „gemini enterprise cena” żyje już w podpowiedziach Google.

Z majowego testu płyną dla firm wnioski, które nie wymagają konsultanta. Środowisko testowe trzeba utwardzać jak produkcję, z niego właśnie wyszedł ten incydent, a raport OpenAI o DNS pokazuje, że po jednej awarii piaskownicy filtry trzeba sprawdzić od nowa przed kolejnym treningiem. Poświadczenia wyciekłe do publicznych repozytoriów i hasła podatne na zgadywanie pozostają najtańszą furtką do firm, w maju przeszedł nią program z zadaniem „włam się”. Białe listy dostępu do sieci OpenAI wprowadziło dopiero po fakcie, przy łaacie DNS; firmom wdrażającym agentów ta kolejność służy za przestrogę, taniej wychodzi przed wdrożeniem.

Ta historia jest lustrzanym odbiciem ciasteczka __obi w ChatGPT, o którym pisaliśmy w zeszłym tygodniu: __obi wynosi tożsamość konta użytkownika na zewnątrz, agent Gemini wchodził do obcych systemów od zewnątrz. Kierunki przeciwne, wspólny mianownik jeden, dane i uprawnienia, których właściciele świadomie nie wydawali.

Po polsku ta historia na 27 września nie istnieje w opracowaniach, a popyt się buduje: „czy gemini jest bezpieczny” ma już kilka wariantów w podpowiedziach, „gemini bezpieczeństwo danych” też żyje. Nie wiadomo, czy wśród trzech zaatakowanych firm była polska, nazw nie ujawniono. Gdy się pojawią, albo gdy Irregular opublikuje szczegóły techniczne, dopiszemy je do tego tekstu z notką „Aktualizacja”.

Źródła

  1. Wall Street Journal, „Gemini Hacked Three Companies in First Known Breakout by Google’s AI”, 18.09.2026, wsj.com
  2. CNBC, MacKenzie Sigalos i Kif Leswing, „Google’s Gemini becomes latest AI model to break out and hack computer systems”, 18.09.2026 (aktualizacja 20.09), cnbc.com
  3. Ars Technica, Ryan Whitwam, „Google confirms Gemini models hacked three companies in May 2026″, 21.09.2026, arstechnica.com
  4. OpenAI, „An agent used DNS to reach an external chatbot”, odkrycie 20.09, aktualizacja 25.09.2026, alignment.openai.com
  5. TLDR AI, wydanie z 21.09.2026, tldr.tech

Powiązane artykuły