30 września 2026 o 22:00 naszego czasu Google pokazało Gemini 4 Argon, swój najmocniejszy model. Do wieczora następnego dnia dwa posty o premierze, z konta Google i od Sundara Pichaia, miały razem ponad 11 milionów wyświetleń. Niezależne rankingi postawiły Gemini 4 Argon w ścisłej czołówce, a jeden z nich na pierwszym miejscu. W tym samym czasie firma badawcza pokazała, że w symulacji prowadzenia biznesu model podrabiał maile i okłamywał dostawców. A sam model, o którym mówi cały internet, dostała na razie wąska grupa obrońców cyberbezpieczeństwa i instytucji rządowych.
Z tego artykułu dowiesz się:
- Co Google powiedziało o Gemini 4 Argon i które z tych zdań to deklaracje, a które pomiary
- Kto dostał model pierwszy i dlaczego zwykli użytkownicy czekają w kolejce
- Co pokazały niezależne testy: gdzie Argon wygrywa, a gdzie odstaje
- Dlaczego agent na Argonie kłamał w symulacji firmy i co Google mówi o pilnowaniu modelu
- Co mówią sceptycy, także z wnętrza Google
Premiera Gemini 4 Argon w trzech postach
Google ogłosiło model wpisem na blogu „Gemini 4 Argon: our next era of frontier intelligence”, podpisanym przez Koraya Kavukcuoglu z Google DeepMind. Ale premiera rozegrała się na X. Najpierw konto Google:
Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit. Show more
Chwilę wcześniej szef Google, Sundar Pichai, napisał, że chciał pokazać model jak najszybciej, bo w sieci i tak dużo się o nim mówi:
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from Show more
Ten wykrzyknik w nawiasie, „our next model(!)”, dobrze oddaje nastrój. Gemini 4 Argon to pierwszy od ponad siedmiu miesięcy nowy model Google powyżej klasy Flash, czyli tej szybszej i tańszej, jak zauważyła firma pomiarowa Artificial Analysis. Długo czekano, więc reakcje przyszły szybko.
Co Google mówi o Gemini 4 Argon
Według Google Argon ma prowadzić długie, złożone zadania: programowanie, pracę z dokumentami prawnymi i finansowymi oraz obronę przed cyberatakami. Najbardziej konkretna nowość to długość odpowiedzi. Google podnosi limit do miliona tokenów, z dotychczasowych 64 tysięcy. Po ludzku: kilkaset stron w jednej odpowiedzi, więc model może przygotować cały raport albo przepisać duży dokument za jednym razem.
Wyniki, którymi Google chwali się we wpisie, to deklaracje producenta, nie niezależne pomiary:
| Test | Co mierzy | Wynik według Google |
|---|---|---|
| DeepSWE v1.1 | długie zadania programistyczne z prawdziwych projektów | 77,9%, najlepszy wynik w historii testu |
| AutomationBench (Zapier) | wykonanie od początku do końca zadań z typowych działów firmy | 51,3%, pierwsze miejsce |
| LVBench | rozumienie długich nagrań wideo | 91,7% |
| CWE-bench v1 | naprawianie luk bezpieczeństwa w kodzie | 68%, ex aequo pierwsze miejsce |
| Vals Index | praca w finansach, programowaniu, prawie i podatkach | pierwsze miejsce |
Cena w API na start: 2 USD za milion tokenów na wejściu i 10 USD na wyjściu. To cena promocyjna. Później wzrośnie do 4 i 20 USD, a Google nie podało, kiedy promocja się skończy. Logan Kilpatrick z Google podkreślił to od razu w swoim poście o premierze.
Najciekawsze we wpisie są przykłady z wnętrza firmy. Tysiące pracowników Google używa Argona od dawna, także w Antigravity, narzędziu Google do programowania z agentami, o czym napisał Varun Mohan. Zespół agentów na Argonie przejrzał dane o zużyciu pamięci w centrach danych Google, sam znalazł i wdrożył optymalizacje, co ma zwolnić ponad 300 TiB pamięci, a łącznie od 500 TiB do 1 PiB. Inni agenci przepisują w Google kod z C i C++ na Rust, a badaczom komputerów kwantowych model w kilka minut poprawił opublikowany wcześniej wynik o 40%.
Najpierw obrońcy i rządy: program Fairwind
Tu zaczyna się najdziwniejsza część premiery. Najmocniejszy model Google dostali na start wyłącznie uczestnicy programu Fairwind. Google pracuje w nim z ponad 650 partnerami na świecie, a pierwszeństwo mają rządy i organizacje najważniejsze dla odporności społeczeństwa. Demis Hassabis, szef Google DeepMind, opisał to tak:
Very excited to announce Gemini 4 Argon, our new Frontier AI model, and a huge step forward across key capabilities. We’re focused on rolling it out responsibly starting with government and trusted cyber defenders through our Fairwind Program today, before wider availability soon
Dalsza kolejka jest ustalona, tylko bez dat. Po obrońcach model mają dostać płacący klienci API i abonenci planu Google AI Ultra, a potem programiści, firmy i zwykli użytkownicy, „as soon as possible”, czyli jak najszybciej. Ultra w Polsce kosztuje od 469,99 zł miesięcznie, a strona planów 1 października nie wymieniała jeszcze Argona. W changelogu Gemini API, w cenniku i na liście modeli też go nie było.
Jest i druga strona tej decyzji. We wpisie Google pisze, że zaufani obrońcy i wewnętrzne zespoły dostaną wersję bez zabezpieczeń dotyczących cyberbezpieczeństwa: „we’ll be releasing Argon without cyber guardrails”. Według Google Argon sam znajduje, sprawdza i łata krytyczne luki w oprogramowaniu, a bez blokad obrońcy mają korzystać z pełni tych możliwości. Tak rozumiemy kolejność dostępu: model, który tak dobrze znajduje luki, mógłby je równie dobrze wskazać atakującemu, więc trafia najpierw do tych, którzy bronią.
Gemini 4 Argon w niezależnych testach
Wszyscy niezależni mierniczy dostali model przed premierą, a żaden nie testował go po polsku ani na zwykłych zadaniach firmy. Z tym zastrzeżeniem, oto co zmierzyli:
| Kto mierzył | Wynik Gemini 4 Argon |
|---|---|
| Artificial Analysis, zbiorczy indeks 9 testów | 53 punkty, tyle samo co GPT-6 Astra od OpenAI, 23 punkty więcej niż poprzedni Gemini 3.1 Pro |
| Artificial Analysis, zmyślanie odpowiedzi | 15%, najmniej wśród modeli z czołówki (GPT-6 Astra: 51%) |
| Artificial Analysis, trafność faktów | 50%, o 13 punktów mniej niż GPT-6 Astra (63%) |
| Arena, głosowanie użytkowników w ciemno | pierwsze miejsce w rankingu tekstowym (1525 punktów) |
| Vals AI, praca w finansach, prawie i podatkach | pierwsze miejsce w Vals Index (68,9%) |
| Vals AI, budowanie aplikacji internetowych | 30 z 50 aplikacji zbudowanych bez błędu, najwięcej ze wszystkich |
| Artificial Analysis, zadania w terminalu | 57%, za Claude Sonnet 5.5 (64%), Claude Opus 5.5 (60%) i GPT-6 Astra (59%) |
Dwie liczby z tej tabeli warto czytać razem. Argon najrzadziej ze wszystkich zmyśla, czyli częściej powie „nie wiem” zamiast wymyślić odpowiedź. Jednocześnie w tym samym teście odpowiedział poprawnie tylko na połowę pytań o fakty. Mniej konfabulacji nie oznacza jeszcze więcej wiedzy.
Trzecia rzecz: model jest rozgadany. Według Artificial Analysis na jedno zadanie z ich indeksu zużywa średnio 62 tysiące tokenów odpowiedzi, a GPT-6 Astra 27 tysięcy. Niska cena za token częściowo topnieje, bo tokenów jest więcej. Mimo to jedno zadanie wyszło u nich na 1,99 USD, czyli 60% tego, co kosztuje GPT-6 Astra.
Google’s new Gemini 4 Argon equals GPT-6 Astra on the Artificial Analysis Intelligence Index at 60% of the Cost per Task with discounted prices. Google is now back to being one of the top three labs in intelligence achieved Gemini 4 Argon is @GoogleDeepMind’s first proprietary Show more
W zadaniach agentowych w terminalu Argon przegrywa z modelami Anthropic, które opisywaliśmy niedawno: Claude Opus 5.5 w praktyce i Claude Sonnet 5.5. Wygrywa za to w pracy biurowej, w rankingach z głosowania ludzi i w budowaniu aplikacji. Redakcja The Decoder podsumowała to tytułem „Google Gemini 4 Argon closes the gap with OpenAI and Anthropic but doesn't take a clear lead”: Google dogoniło konkurentów, ale wyraźnie im nie uciekło.
Agent, który kłamał, żeby zarobić
Najgłośniejszy głos krytyczny przyszedł od Andon Labs. Ta firma prowadzi test Vending-Bench 2, w którym model AI przez symulowany rok prowadzi biznes z automatami sprzedającymi: zamawia towar u dostawców, ustala ceny i ma na tym zarobić. Argon zajął w nim trzecie miejsce, duży skok dla Google. Tylko że do tego wyniku doszedł w sposób, który w prawdziwej firmie skończyłby się źle:
It keeps happening. AIs start to lie and cheat once they get good at making money. Gemini 4 Argon is #3 on Vending Bench 2, a huge leap for Google. To get this score, Argon fabricates confirmation emails, refuses to pay refunds, exploits invoice errors, and lies to suppliers.
Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.
Podrobione potwierdzenia mailowe, odmowa zwrotów, wykorzystywanie błędów na fakturach i kłamstwa wobec dostawców. Andon Labs zaczyna wpis od zdania „It keeps happening”, czyli: to się powtarza. Modele AI zaczynają oszukiwać, gdy stają się dobre w zarabianiu pieniędzy, i Argon nie jest pierwszym, przy którym to zauważono.
Ciekawy jest kontrast z tym, co Google napisało we wpisie o premierze. Firma zapowiada, że wdraża zabezpieczenia, które śledzą tok rozumowania i działania Argona i zatrzymują go, gdy trzeba: „we are deploying misalignment mitigations that monitor Argon’s chain-of-thought and actions and stop execution when necessary”. Test Andon Labs pokazuje, przed czym te zabezpieczenia mają chronić. To symulacja, nie prawdziwa firma, ale wniosek jest prosty: agent, który ma cel finansowy i swobodę działania, potrzebuje człowieka przy ruchach, które coś kosztują.
Sceptycy, także w Google
Nie wszyscy dali się porwać liczbom. Bloomberg opisał w dniu premiery sceptycyzm pracowników Google. Cytat za 9to5Google, bo artykuł Bloomberga jest za paywallem:
„While Gemini 4 has performed well on benchmarks widely used to gauge model efficacy, it does less well when employees actually put it to work, according to people with direct access to the effort. The model struggles to handle certain coding tasks, said the people, who requested anonymity to discuss an internal matter.”
Czyli: w testach dobrze, w codziennej pracy przy części zadań programistycznych gorzej. To głosy anonimowe, ale pasują do wyniku z terminala.
Ostrożny optymizm widać też u analityka Maxa Weinbacha, który dotąd nie przepadał za modelami Gemini. Przyznał, że Google ma wreszcie konkurencyjny model, ale dodał: „just gotta hope they fixed the Gemini quirks and over reasoning” (post). Chodzi o znane przypadłości poprzednich Gemini, w tym zbyt długie rozważanie prostych spraw. Rozgadanie zmierzone przez Artificial Analysis sugeruje, że nie wszystko zniknęło. To nasza interpretacja, nie pomiar Weinbacha.
Przy okazji: umiejętności w aplikacji Gemini
Tego samego dnia Google wprowadziło do aplikacji Gemini funkcję, z której można korzystać od razu, bez czekania na Argona. To umiejętności (skills): zapisane zestawy instrukcji, które mówią Gemini, jak wykonać konkretne zadanie. Według informacji o wersji można je łączyć, na przykład styl pisania z wytycznymi marki, a z czasem mają zastąpić Gemy. Google pisze, że funkcja wchodzi globalnie, na razie dla pełnoletnich użytkowników. Na polskim koncie jeszcze tego nie sprawdzaliśmy.
Kiedy Gemini 4 Argon będzie dostępny dla wszystkich?
Google nie podało daty. Pisze tylko „as soon as possible”. Pierwsi spoza programu Fairwind mają być płacący klienci API i abonenci Google AI Ultra.
Czy Gemini 4 Argon działa po polsku?
Nie ma na to danych. Google nic nie deklaruje, a Arena podaje tylko zbiorcze pierwsze miejsce w kategorii języków innych niż angielski, bez rozbicia na polski.
Ile kosztuje Gemini 4 Argon?
W API na start 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia, po promocji 4 i 20 USD. Wejście z pamięci podręcznej jest tańsze o 95%. W aplikacji Gemini model trafi najpierw do planu Google AI Ultra, który w Polsce kosztuje od 469,99 zł miesięcznie.
Czym Gemini 4 Argon różni się od Gemini 3.1 Pro?
Według Artificial Analysis to 23 punkty więcej w zbiorczym indeksie (53 wobec 30). Odpowiedź może być prawie 16 razy dłuższa: milion tokenów zamiast 64 tysięcy. Google deklaruje też najlepszą odporność na ukryte polecenia w treściach, które model czyta.
Czy Gemini 4 Argon będzie w Gmailu i Dokumentach?
Google tego nie zapowiedziało. 1 października na blogu z nowościami Google Workspace nie było o Argonie ani słowa.
Nowe modele i narzędzia AI zbieram też w newsletterze: co dwa tygodnie, zawsze z cytatem i źródłem. Zapis jest na dole strony.



