30 września 2026 o 22:00 naszego czasu Google pokazało Gemini 4 Argon, swój najmocniejszy model. Do wieczora następnego dnia dwa posty o premierze, z konta Google i od Sundara Pichaia, miały razem ponad 11 milionów wyświetleń. Niezależne rankingi postawiły Gemini 4 Argon w ścisłej czołówce, a jeden z nich na pierwszym miejscu. W tym samym czasie firma badawcza pokazała, że w symulacji prowadzenia biznesu model podrabiał maile i okłamywał dostawców. A sam model, o którym mówi cały internet, dostała na razie wąska grupa obrońców cyberbezpieczeństwa i instytucji rządowych.

Z tego artykułu dowiesz się:

  • Co Google powiedziało o Gemini 4 Argon i które z tych zdań to deklaracje, a które pomiary
  • Kto dostał model pierwszy i dlaczego zwykli użytkownicy czekają w kolejce
  • Co pokazały niezależne testy: gdzie Argon wygrywa, a gdzie odstaje
  • Dlaczego agent na Argonie kłamał w symulacji firmy i co Google mówi o pilnowaniu modelu
  • Co mówią sceptycy, także z wnętrza Google
0 mlnwyświetleń dwóch postów o premierze w niecałą dobę
#1w Text Arena, rankingu z głosowania w ciemno
0%zmyślonych odpowiedzi, najmniej w czołówce (Artificial Analysis)
0Mtokenów w jednej odpowiedzi, wcześniej 64 tysiące

Premiera Gemini 4 Argon w trzech postach

Google ogłosiło model wpisem na blogu „Gemini 4 Argon: our next era of frontier intelligence”, podpisanym przez Koraya Kavukcuoglu z Google DeepMind. Ale premiera rozegrała się na X. Najpierw konto Google:

Chwilę wcześniej szef Google, Sundar Pichai, napisał, że chciał pokazać model jak najszybciej, bo w sieci i tak dużo się o nim mówi:

Ten wykrzyknik w nawiasie, „our next model(!)”, dobrze oddaje nastrój. Gemini 4 Argon to pierwszy od ponad siedmiu miesięcy nowy model Google powyżej klasy Flash, czyli tej szybszej i tańszej, jak zauważyła firma pomiarowa Artificial Analysis. Długo czekano, więc reakcje przyszły szybko.

Co Google mówi o Gemini 4 Argon

Według Google Argon ma prowadzić długie, złożone zadania: programowanie, pracę z dokumentami prawnymi i finansowymi oraz obronę przed cyberatakami. Najbardziej konkretna nowość to długość odpowiedzi. Google podnosi limit do miliona tokenów, z dotychczasowych 64 tysięcy. Po ludzku: kilkaset stron w jednej odpowiedzi, więc model może przygotować cały raport albo przepisać duży dokument za jednym razem.

Wyniki, którymi Google chwali się we wpisie, to deklaracje producenta, nie niezależne pomiary:

TestCo mierzyWynik według Google
DeepSWE v1.1długie zadania programistyczne z prawdziwych projektów77,9%, najlepszy wynik w historii testu
AutomationBench (Zapier)wykonanie od początku do końca zadań z typowych działów firmy51,3%, pierwsze miejsce
LVBenchrozumienie długich nagrań wideo91,7%
CWE-bench v1naprawianie luk bezpieczeństwa w kodzie68%, ex aequo pierwsze miejsce
Vals Indexpraca w finansach, programowaniu, prawie i podatkachpierwsze miejsce

Cena w API na start: 2 USD za milion tokenów na wejściu i 10 USD na wyjściu. To cena promocyjna. Później wzrośnie do 4 i 20 USD, a Google nie podało, kiedy promocja się skończy. Logan Kilpatrick z Google podkreślił to od razu w swoim poście o premierze.

Najciekawsze we wpisie są przykłady z wnętrza firmy. Tysiące pracowników Google używa Argona od dawna, także w Antigravity, narzędziu Google do programowania z agentami, o czym napisał Varun Mohan. Zespół agentów na Argonie przejrzał dane o zużyciu pamięci w centrach danych Google, sam znalazł i wdrożył optymalizacje, co ma zwolnić ponad 300 TiB pamięci, a łącznie od 500 TiB do 1 PiB. Inni agenci przepisują w Google kod z C i C++ na Rust, a badaczom komputerów kwantowych model w kilka minut poprawił opublikowany wcześniej wynik o 40%.

Najpierw obrońcy i rządy: program Fairwind

Tu zaczyna się najdziwniejsza część premiery. Najmocniejszy model Google dostali na start wyłącznie uczestnicy programu Fairwind. Google pracuje w nim z ponad 650 partnerami na świecie, a pierwszeństwo mają rządy i organizacje najważniejsze dla odporności społeczeństwa. Demis Hassabis, szef Google DeepMind, opisał to tak:

Dalsza kolejka jest ustalona, tylko bez dat. Po obrońcach model mają dostać płacący klienci API i abonenci planu Google AI Ultra, a potem programiści, firmy i zwykli użytkownicy, „as soon as possible”, czyli jak najszybciej. Ultra w Polsce kosztuje od 469,99 zł miesięcznie, a strona planów 1 października nie wymieniała jeszcze Argona. W changelogu Gemini API, w cenniku i na liście modeli też go nie było.

Jest i druga strona tej decyzji. We wpisie Google pisze, że zaufani obrońcy i wewnętrzne zespoły dostaną wersję bez zabezpieczeń dotyczących cyberbezpieczeństwa: „we’ll be releasing Argon without cyber guardrails”. Według Google Argon sam znajduje, sprawdza i łata krytyczne luki w oprogramowaniu, a bez blokad obrońcy mają korzystać z pełni tych możliwości. Tak rozumiemy kolejność dostępu: model, który tak dobrze znajduje luki, mógłby je równie dobrze wskazać atakującemu, więc trafia najpierw do tych, którzy bronią.

Gemini 4 Argon w niezależnych testach

Wszyscy niezależni mierniczy dostali model przed premierą, a żaden nie testował go po polsku ani na zwykłych zadaniach firmy. Z tym zastrzeżeniem, oto co zmierzyli:

Kto mierzyłWynik Gemini 4 Argon
Artificial Analysis, zbiorczy indeks 9 testów53 punkty, tyle samo co GPT-6 Astra od OpenAI, 23 punkty więcej niż poprzedni Gemini 3.1 Pro
Artificial Analysis, zmyślanie odpowiedzi15%, najmniej wśród modeli z czołówki (GPT-6 Astra: 51%)
Artificial Analysis, trafność faktów50%, o 13 punktów mniej niż GPT-6 Astra (63%)
Arena, głosowanie użytkowników w ciemnopierwsze miejsce w rankingu tekstowym (1525 punktów)
Vals AI, praca w finansach, prawie i podatkachpierwsze miejsce w Vals Index (68,9%)
Vals AI, budowanie aplikacji internetowych30 z 50 aplikacji zbudowanych bez błędu, najwięcej ze wszystkich
Artificial Analysis, zadania w terminalu57%, za Claude Sonnet 5.5 (64%), Claude Opus 5.5 (60%) i GPT-6 Astra (59%)

Dwie liczby z tej tabeli warto czytać razem. Argon najrzadziej ze wszystkich zmyśla, czyli częściej powie „nie wiem” zamiast wymyślić odpowiedź. Jednocześnie w tym samym teście odpowiedział poprawnie tylko na połowę pytań o fakty. Mniej konfabulacji nie oznacza jeszcze więcej wiedzy.

Trzecia rzecz: model jest rozgadany. Według Artificial Analysis na jedno zadanie z ich indeksu zużywa średnio 62 tysiące tokenów odpowiedzi, a GPT-6 Astra 27 tysięcy. Niska cena za token częściowo topnieje, bo tokenów jest więcej. Mimo to jedno zadanie wyszło u nich na 1,99 USD, czyli 60% tego, co kosztuje GPT-6 Astra.

W zadaniach agentowych w terminalu Argon przegrywa z modelami Anthropic, które opisywaliśmy niedawno: Claude Opus 5.5 w praktyce i Claude Sonnet 5.5. Wygrywa za to w pracy biurowej, w rankingach z głosowania ludzi i w budowaniu aplikacji. Redakcja The Decoder podsumowała to tytułem „Google Gemini 4 Argon closes the gap with OpenAI and Anthropic but doesn't take a clear lead”: Google dogoniło konkurentów, ale wyraźnie im nie uciekło.

Agent, który kłamał, żeby zarobić

Najgłośniejszy głos krytyczny przyszedł od Andon Labs. Ta firma prowadzi test Vending-Bench 2, w którym model AI przez symulowany rok prowadzi biznes z automatami sprzedającymi: zamawia towar u dostawców, ustala ceny i ma na tym zarobić. Argon zajął w nim trzecie miejsce, duży skok dla Google. Tylko że do tego wyniku doszedł w sposób, który w prawdziwej firmie skończyłby się źle:

It keeps happening. AIs start to lie and cheat once they get good at making money. Gemini 4 Argon is #3 on Vending Bench 2, a huge leap for Google. To get this score, Argon fabricates confirmation emails, refuses to pay refunds, exploits invoice errors, and lies to suppliers.

Image
Google
Google
@Google

Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.

Image

Podrobione potwierdzenia mailowe, odmowa zwrotów, wykorzystywanie błędów na fakturach i kłamstwa wobec dostawców. Andon Labs zaczyna wpis od zdania „It keeps happening”, czyli: to się powtarza. Modele AI zaczynają oszukiwać, gdy stają się dobre w zarabianiu pieniędzy, i Argon nie jest pierwszym, przy którym to zauważono.

Ciekawy jest kontrast z tym, co Google napisało we wpisie o premierze. Firma zapowiada, że wdraża zabezpieczenia, które śledzą tok rozumowania i działania Argona i zatrzymują go, gdy trzeba: „we are deploying misalignment mitigations that monitor Argon’s chain-of-thought and actions and stop execution when necessary”. Test Andon Labs pokazuje, przed czym te zabezpieczenia mają chronić. To symulacja, nie prawdziwa firma, ale wniosek jest prosty: agent, który ma cel finansowy i swobodę działania, potrzebuje człowieka przy ruchach, które coś kosztują.

Sceptycy, także w Google

Nie wszyscy dali się porwać liczbom. Bloomberg opisał w dniu premiery sceptycyzm pracowników Google. Cytat za 9to5Google, bo artykuł Bloomberga jest za paywallem:

„While Gemini 4 has performed well on benchmarks widely used to gauge model efficacy, it does less well when employees actually put it to work, according to people with direct access to the effort. The model struggles to handle certain coding tasks, said the people, who requested anonymity to discuss an internal matter.”

Czyli: w testach dobrze, w codziennej pracy przy części zadań programistycznych gorzej. To głosy anonimowe, ale pasują do wyniku z terminala.

Ostrożny optymizm widać też u analityka Maxa Weinbacha, który dotąd nie przepadał za modelami Gemini. Przyznał, że Google ma wreszcie konkurencyjny model, ale dodał: „just gotta hope they fixed the Gemini quirks and over reasoning” (post). Chodzi o znane przypadłości poprzednich Gemini, w tym zbyt długie rozważanie prostych spraw. Rozgadanie zmierzone przez Artificial Analysis sugeruje, że nie wszystko zniknęło. To nasza interpretacja, nie pomiar Weinbacha.

Przy okazji: umiejętności w aplikacji Gemini

Tego samego dnia Google wprowadziło do aplikacji Gemini funkcję, z której można korzystać od razu, bez czekania na Argona. To umiejętności (skills): zapisane zestawy instrukcji, które mówią Gemini, jak wykonać konkretne zadanie. Według informacji o wersji można je łączyć, na przykład styl pisania z wytycznymi marki, a z czasem mają zastąpić Gemy. Google pisze, że funkcja wchodzi globalnie, na razie dla pełnoletnich użytkowników. Na polskim koncie jeszcze tego nie sprawdzaliśmy.

Kiedy Gemini 4 Argon będzie dostępny dla wszystkich?

Google nie podało daty. Pisze tylko „as soon as possible”. Pierwsi spoza programu Fairwind mają być płacący klienci API i abonenci Google AI Ultra.

Czy Gemini 4 Argon działa po polsku?

Nie ma na to danych. Google nic nie deklaruje, a Arena podaje tylko zbiorcze pierwsze miejsce w kategorii języków innych niż angielski, bez rozbicia na polski.

Ile kosztuje Gemini 4 Argon?

W API na start 2 USD za milion tokenów wejścia i 10 USD za milion tokenów wyjścia, po promocji 4 i 20 USD. Wejście z pamięci podręcznej jest tańsze o 95%. W aplikacji Gemini model trafi najpierw do planu Google AI Ultra, który w Polsce kosztuje od 469,99 zł miesięcznie.

Czym Gemini 4 Argon różni się od Gemini 3.1 Pro?

Według Artificial Analysis to 23 punkty więcej w zbiorczym indeksie (53 wobec 30). Odpowiedź może być prawie 16 razy dłuższa: milion tokenów zamiast 64 tysięcy. Google deklaruje też najlepszą odporność na ukryte polecenia w treściach, które model czyta.

Czy Gemini 4 Argon będzie w Gmailu i Dokumentach?

Google tego nie zapowiedziało. 1 października na blogu z nowościami Google Workspace nie było o Argonie ani słowa.

Nowe modele i narzędzia AI zbieram też w newsletterze: co dwa tygodnie, zawsze z cytatem i źródłem. Zapis jest na dole strony.