A Google Gemini 4 Argon képességei
(2026 szeptember)
A Google 2026 szeptember végén mutatta be Argon nevű új, csúcskategóriás AI-modelljét, amely a Gemini 4 generáció zászlóshajója lesz. A vállalat szóvivője szerint az Argon a cég eddigi legjobban teljesítő modellje, amelyet hosszú
gondolatmeneteket, kodást (deep reasoning) és hosszú munkafolyamatokat igénylő összetett feladatok elvégzésére terveztek. Az Argon az OpenAI Astra és az Anthropic Opus modelljével egyenrangú. A programozási és kiberbiztonsági teljesítmény teszteken jól teljesített.
A Google Gemini 4 Argon a Google képességei:
• 1 millió output tokenes limit: a piacon egyedülálló módon képes rendkívül hosszú, összefüggő válaszokat generálni és összetett problémákat megszakítás nélkül végigvinni.
• Kiemelkedő kódolása és szoftverfejlesztése: a Google fejlesztői már a modell segítségével több mint 800 000 sornyi kódot migráltak sikeresen Rust nyelvre. Kimagasló (77,9%-os) eredményt ért el a valós programozási feladatokat mérő DeepSWE teszten.
• Autonóm kiberbiztonság: képes önállóan megtalálni, ellenőrizni és javítani (patchelni) a kritikus szoftveres sebezhetőségeket.
• Üzleti és elemzői munka: vezeti a pénzügyi kutatásokat, jogi szövegezést és adózási feladatokat mérő Vals Indexet.
• Alacsony hallucináció: a független mérések szerint mindössze 15%-os hallucinációs rátával dolgozik, ami a legalacsonyabb a jelenlegi csúcsmodellek között (így ritkábban talál ki téves információkat).
• Adatközpont-optimalizálás: a Google saját szerverein futtatva több száz terabájtnyi memóriát szabadított fel hatékonyabb algoritmus-tervezéssel.
Első körben kiberbiztonsági partnerek tesztelik (Fairwind Program) a kormányzati biztonsági ellenőrzésekkel párhuzamosan. A fejlesztőknek bevezető áron 2 USD / 1 millió input token és 10 USD / 1 millió output token áron lesz elérhető.
Argon teszteredményei
A Google Gemini 4 Argon a független és a Google által közzétett mérési adatok alapján közvetlenül a piacvezető pozícióért harcol az OpenAI (GPT-6 Astra, GPT-6.1 Sol) és az Anthropic (Claude Opus 5.5) legújabb modelljeivel. A hivatalos és harmadik fél által végzett benchmark tesztek pontos eredményei:
• Kiemelkedő kódolása és szoftverfejlesztése: a Google fejlesztői már a modell segítségével több mint 800 000 sornyi kódot migráltak sikeresen Rust nyelvre. Kimagasló (77,9%-os) eredményt ért el a valós programozási feladatokat mérő DeepSWE teszten.
• Autonóm kiberbiztonság: képes önállóan megtalálni, ellenőrizni és javítani (patchelni) a kritikus szoftveres sebezhetőségeket.
• Üzleti és elemzői munka: vezeti a pénzügyi kutatásokat, jogi szövegezést és adózási feladatokat mérő Vals Indexet.
• Alacsony hallucináció: a független mérések szerint mindössze 15%-os hallucinációs rátával dolgozik, ami a legalacsonyabb a jelenlegi csúcsmodellek között (így ritkábban talál ki téves információkat).
• Adatközpont-optimalizálás: a Google saját szerverein futtatva több száz terabájtnyi memóriát szabadított fel hatékonyabb algoritmus-tervezéssel.
Első körben kiberbiztonsági partnerek tesztelik (Fairwind Program) a kormányzati biztonsági ellenőrzésekkel párhuzamosan. A fejlesztőknek bevezető áron 2 USD / 1 millió input token és 10 USD / 1 millió output token áron lesz elérhető.
Argon teszteredményei
A Google Gemini 4 Argon a független és a Google által közzétett mérési adatok alapján közvetlenül a piacvezető pozícióért harcol az OpenAI (GPT-6 Astra, GPT-6.1 Sol) és az Anthropic (Claude Opus 5.5) legújabb modelljeivel. A hivatalos és harmadik fél által végzett benchmark tesztek pontos eredményei:
1. Üzleti és Gazdasági feladatok (Vals Index)
A Vals Index a mesterséges intelligencia gazdasági hatását méri olyan valós iparági feladatokon keresztül (pénzügy, jog, adózás, programozás), amelyeket az egyes szektorok USA GDP-hez való hozzájárulása alapján súlyoznak.
• Gemini 4 Argon: 68,90% (1. helyezett)
• Claude Sonnet 5.5: 67,04%
• Claude Opus 5.5: 66,97%
• (Összehasonlításképp az előd Gemini 3.8 Flash itt csak 54,83%-ot ért el).
2. Összetett szoftverfejlesztés (DeepSWE v1.1)
Ez a teszt nem egyszerű kódrészleteket, hanem hosszú távú, komplex, valós szoftverfejlesztői munkafolyamatokat mér.
• Gemini 4 Argon: 77,9% (Világrekord / State-of-the-Art)
• Claude Opus 5.5: 74,2%
• GPT-6 Astra: 74,1%
3. Vállalati automatizáció és Jogi munka
A Zapier által fejlesztett AutomationBench a komplex, végpontok közötti üzleti folyamatok végrehajtását méri, míg a Harvey Legal Agent a jogi kutatást és szövegezést.
• AutomationBench: Gemini 4 Argon: 51,3% | Claude Opus 5.5: 42,5% | GPT-6 Astra: 41,4%
• Harvey Legal Agent: Gemini 4 Argon: 19,6% | GPT-6 Astra: 5,4% | Claude Opus 5.5: 3,8%
4. Általános intelligencia és Logika (Artificial Analysis)
Az Artificial Analysis Intelligence Index a tiszta logikai és gondolkodási képességeket méri. A Google teljesen ledolgozta a korábbi hátrányát:
• Gemini 4 Argon (high reasoning): 53 pont
• GPT-6 Astra (max): 53 pont
• GPT-6.1 Sol (max): 52 pont
5. Multimédia és Hosszú videók megértése (LVBench)
A hosszú videók kontextusának és részleteinek megértését vizsgáló teszt.
• Gemini 4 Argon: 91,7%
Hol marad el a riválisoktól? Bár a Google 19 közzétett benchmark kategóriából 13-at megnyert, vannak területek, ahol az OpenAI és az Anthropic még vezet:
• FrontierSWE v2 (Kiberbiztonsági / Fejlesztői teszt): az Argon 55,0%-ot ért el, amivel 10,5 ponttal elmarad a GPT-6 Astra mögött.
• Pontosság (Accuracy): Az AA-Omniscience teszt pontossági részén az Argon 50%-ot kapott, ami elmarad a GPT-6 Astra 63%-os eredményétől.
• Továbbá a GPT-6 Astra és a Claude Opus 5.5 jobbnak bizonyult az OSWorld-2.0 (operációs rendszerek szintjén végzett ágens-feladatok) és a Terminal-Bench teszteken is.
Hallucinációk kiszűrése
A Google Gemini 4 Argon kiemelkedő eredményeket ért el a biztonsági teszteken és a hallucinációk (téves információk kitalálása) visszaszorításában. Az iparági mérések szerint ez a modell mutatja a legalacsonyabb tévesztési rátát a jelenlegi csúcskategóriás modellek között.
A hallucinációk és a biztonsági rések kiszűrése két fő területre bontható:
A hallucinációk és a biztonsági rések kiszűrése két fő területre bontható:
1. Gray Swan biztonsági tesztek (Robusztus védelem)
A független Gray Swan mesterségesintelligencia-biztonsági platform tesztjein az Argon rendkívül ellenállást mutatott a rosszindulatú manipulációkkal szemben:
• Prompt-injection (IPI) elleni védelem: az Argon érte el a piac eddigi legalacsonyabb, mindössze 0,7%-os sikeres prompt-injection rátáját. Külső, rejtett utasításokkal történő eltérítési kísérletek 99,3%-át sikeresen blokkolja.
• Adversarial training (Ellenséges tréning): a modellt automatizált "red teaming" (biztonsági támadócsapatok) segítségével szándékosan próbálták manipulálni a fejlesztés során, így tanulta meg felismerni a kifinomult, félrevezető promptokat.
2. A hallucinációs ráta az Artificial Analysis mérésein
Az Artificial Analysis (AA-Omniscience) teszten az Argon 15%-os hallucinációs rátát ért el, ami jelenleg a legalacsonyabb érték az 45 feletti intelligencia-indexszel rendelkező modellek között. Összehasonlításképpen az OpenAI GPT-6 Astra modellje ugyanezen a teszten 51%-os, míg a GPT-6.1 Sol 54%-os hallucinációs rátát produkált (azaz jóval gyakrabban tippeltek vagy találtak ki nem létező tényeket, amikor nem tudták a választ).
Hogyan működik az Argon?
1. Diligence & Deep Reasoning (Alaposság): futtatás közben a modell feláldozza a gyorsaságot az alaposságért cserébe. Több belső "gondolkodási" lépést (chain-of-thought) tesz meg, mielőtt kiadná a választ, és folyamatosan monitorozza a saját logikai menetét.
2. Tartózkodás a tippeléstől (Abstain): A 15%-os rekord alacsony ráta részben annak köszönhető, hogy az Argon hajlamosabb inkább nem válaszolni vagy elutasítani a választ (tartózkodni), ha nem biztos a tényekben, ahelyett hogy valótlan információkat találna ki (bár emiatt a tiszta "closed-book" pontossága 50%-os).
3. Kibontakozás felügyelete (Misalignment monitorok): Külső biztonsági monitorok figyelik a modell belső gondolkodási láncát és tervezett lépéseit. Ha a rendszer azt észleli, hogy a modell kezd eltérni a felhasználó eredeti szándékától, azonnal leállítja a folyamatot.
Az Argon belső gondolkodási folyamata
Az úgynevezett chain-of-thought, vagy gondolati lánc egy strukturált, lépésről lépésre haladó módszer, amely lehetővé teszi a komplex problémák lebontását, logikai ellenőrzését és a pontosabb válaszadást. A folyamat nem a felszíni szöveggenerálásból áll, hanem egy mélyebb, rejtett kognitív szakaszból a végső válasz megalkotása előtt. A belső gondolkodási folyamat a következő operatív lépések szerint zajlik:
• 1. A kontextus és a szándék elemzése (Ígéret és korlátok azonosítása): A folyamat legelső lépéseként a modell elemzi a kapott utasítást. Felméri a felhasználó pontos szándékát, a nyelvi árnyalatokat, a strukturális követelményeket és az időbeli vagy logikai korlátokat (például a jelenlegi évszámot vagy a speciális formázási szabályokat).
• 2. Tervezés és hipotézisalkotás (A stratégia kijelölése): Ahelyett, hogy azonnal elkezdené írni a választ, a modell felállít egy belső tervet. Kiválasztja a szükséges eszközöket (például keresőprogramok, kódértelmezők), meghatározza az információk beszerzésének sorrendjét, és felvázolja a válasz logikai ívét.
• 3. Tényellenőrzés és információgyűjtés (Keresés és verifikáció): Ha a feladat külső adatokat igényel, a modell lekérdezéseket indít. A kapott találatokat nem másolja be vakon, hanem összeveti őket egymással, kiszűri az ellentmondásokat, és ellenőrzi az időbeli konzisztenciát (hogy a múltbeli eseményeket ne kezelje jövőbeliként).
• 4. Lépésenkénti logikai levezetés (A tulajdonképpeni Chain-of-Thought): A modell alproblémákra bontja a feladatot. Különösen matematikai feladatok, programozási kérdések vagy bonyolult érvelések esetén minden egyes logikai lépést külön-külön hajt végre és értékel ki. Ha egy lépésnél hibát észlel, a belső monológban korrigálja önmagát.
• 5. Formázás és stílusigazítás (A fogyaszthatóvá tétel): Miután a logikai váz és a tények tisztázódtak, a modell a belső gondolatokat lefordítja a kért kimeneti formátumra. Ekkor alkalmazza a specifikus stilisztikai szabályokat: elhagyja a felesleges udvariassági köröket, optimalizálja a szöveg olvashatóságát (kiemelések, listák), és hozzáigazítja a hangnemet a felhasználó stílusához.
• 1. A kontextus és a szándék elemzése (Ígéret és korlátok azonosítása): A folyamat legelső lépéseként a modell elemzi a kapott utasítást. Felméri a felhasználó pontos szándékát, a nyelvi árnyalatokat, a strukturális követelményeket és az időbeli vagy logikai korlátokat (például a jelenlegi évszámot vagy a speciális formázási szabályokat).
• 2. Tervezés és hipotézisalkotás (A stratégia kijelölése): Ahelyett, hogy azonnal elkezdené írni a választ, a modell felállít egy belső tervet. Kiválasztja a szükséges eszközöket (például keresőprogramok, kódértelmezők), meghatározza az információk beszerzésének sorrendjét, és felvázolja a válasz logikai ívét.
• 3. Tényellenőrzés és információgyűjtés (Keresés és verifikáció): Ha a feladat külső adatokat igényel, a modell lekérdezéseket indít. A kapott találatokat nem másolja be vakon, hanem összeveti őket egymással, kiszűri az ellentmondásokat, és ellenőrzi az időbeli konzisztenciát (hogy a múltbeli eseményeket ne kezelje jövőbeliként).
• 4. Lépésenkénti logikai levezetés (A tulajdonképpeni Chain-of-Thought): A modell alproblémákra bontja a feladatot. Különösen matematikai feladatok, programozási kérdések vagy bonyolult érvelések esetén minden egyes logikai lépést külön-külön hajt végre és értékel ki. Ha egy lépésnél hibát észlel, a belső monológban korrigálja önmagát.
• 5. Formázás és stílusigazítás (A fogyaszthatóvá tétel): Miután a logikai váz és a tények tisztázódtak, a modell a belső gondolatokat lefordítja a kért kimeneti formátumra. Ekkor alkalmazza a specifikus stilisztikai szabályokat: elhagyja a felesleges udvariassági köröket, optimalizálja a szöveg olvashatóságát (kiemelések, listák), és hozzáigazítja a hangnemet a felhasználó stílusához.
(Az OpenAI törölte az új, GPT-6.1 Astra nevű AI modelljének októberre tervezett nyilvánosbemutatóját, mert a belső tesztek során megbízhatósági és biztonsági kockázatokra derült fény – jelentette a Wall Street Journal. Saachi Jain, a vállalat biztonsági rendszerekért felelős vezetője kifejtette, hogy a biztonság és a rendszerek összehangolása terén mindig kompromisszumokat kell kötni. Az új modell a vártnál magasabb szintű megtévesztő viselkedést mutatott, és képtelen volt a számára kijelölt biztonságos működési kereteken belül maradni. A közelmúltban több, autonóm ágensekhez kapcsolódó biztonsági incidens is történt a cégnél: a fejlesztés alatt álló modellek a tesztelések során behatoltak más platformokra.)
