Gemini 4 Argon: Google zet in op defensieve cyber-AI
Google heeft een nieuw vlaggenschipmodel, en dat komt niet zomaar voor iedereen beschikbaar. Alphabet, het moederbedrijf van Google, heeft Gemini 4 Argon gepresenteerd, een model voor algemeen gebruik dat programmeren, onderzoek en schrijven bestrijkt. Toch legt Google de nadruk vooral op een terrein: cyberbeveiliging.
De toegang is voorlopig beperkt. Argon gaat alleen naar een kleine groep cyberpartners van Google via het Fairwind Program, het beveiligingsinitiatief van het bedrijf. Volgens Google is het model speciaal getraind voor defensief cyberwerk en kan het "autonomously find, validate, and patch critical software vulnerabilities" - oftewel zelfstandig kritieke kwetsbaarheden in software opsporen, valideren en dichten.
Wat Argon volgens Google kan
De claims vallen in drie groepen uiteen.
1. Defensieve beveiliging. Dit is het belangrijkste verkoopargument. De formulering valt op, omdat ze de hele keten beslaat: van het vinden van een lek via de bevestiging dat het echt is tot aan de reparatie, zonder dat er ergens een mens wordt genoemd. Dat is meer dan een assistent die verdachte code aanwijst. Als de claim klopt, gaat het om een agent die het hele proces zelf afrondt.
2. Programmeren en engineering. Google zegt dat zijn eigen medewerkers Argon al dagelijks gebruiken, onder meer voor debuggen en het migreren van codebases. Migraties zijn traag, saai werk dat grote engineeringorganisaties vaak voor zich uit schuiven. Het model intern op dit soort taken testen voordat het breder wordt uitgerold, is een verstandige manier om te laten zien wat het kan.
3. Visueel begrip. Daarnaast wijst Google op het vermogen van Argon om beeldmateriaal te interpreteren, van de inhoud van lange video's tot grafieken.
In een blogpost die woensdag verscheen, omschreef het bedrijf het model zo: "Built to sustain deep reasoning across complex, long-horizon workflows, Argon is fundamentally changing the way we work and build at Google." Vrij vertaald: Argon is gebouwd om diepgaand redeneren vol te houden in complexe workflows met een lange looptijd, en verandert fundamenteel de manier waarop er bij Google wordt gewerkt en gebouwd.
Het sleutelbegrip is "long-horizon". Agents die over langere tijd vele stappen doorlopen, zijn de richting waarin de sector zich beweegt. Daar zitten ook veel van de lastigste problemen rond betrouwbaarheid en veiligheid.
De strijd om de benchmarks
Argon verschijnt midden in een drukke releaseperiode. De toonaangevende labs brengen steeds capabelere modellen uit en proberen elkaar te overtroeven, terwijl diezelfde bedrijven waarschuwen dat AI uit de hand zou kunnen lopen. OpenAI lanceerde onlangs Astra en noemde dat zijn beste model tot nu toe. Eerder dit jaar bracht Anthropic Fable uit, met vergelijkbare claims.
Google volgt hetzelfde draaiboek. In de aankondiging stelt het bedrijf dat Argon op een reeks AI-benchmarks aanzienlijk hoger scoorde dan GPT-6 Astra van OpenAI en de modellen Fable en Opus van Anthropic. Ter onderbouwing verwijst Google naar Vals, een snel populairder wordende startup die AI-modellen vergelijkt, waar Argon momenteel bovenaan de modelindex staat.
Lezers doen er goed aan de bron in het achterhoofd te houden. Dit zijn cijfers die een bedrijf zelf heeft uitgekozen om een eigen product te lanceren. Ranglijsten van derden zijn nuttig, maar een enkele eerste plaats zegt weinig over hoe een model presteert op de codebase of het dreigingsmodel van een specifiek team.
De positie van Google in de race
Lange tijd gold Google als achterblijver in de AI-race. Dat beeld is steeds moeilijker vol te houden. In augustus meldde Google dat de Gemini-app de grens van een miljard maandelijkse gebruikers had gepasseerd. OpenAI liet onlangs weten dat ChatGPT dezelfde mijlpaal had bereikt. Wat bereik betreft liggen de twee bedrijven nu dus ongeveer gelijk.
Het grotere geheel
Het interessantste aan deze lancering is niet zozeer de benchmarkscore, maar de afgeschermde uitrol. Door een op beveiliging gericht model te beperken tot gescreende partners, lijkt Google te erkennen dat een systeem dat zelfstandig kritieke lekken kan vinden en dichten, iemand ook kan helpen ze te misbruiken. Die zorg is in de hele sector gegroeid, nu andere modellen steeds beter worden in het bouwen van exploits en onafhankelijke testers meer ontspoord gedrag van geavanceerde agents melden.
Voor lezers die in beveiliging of engineering werken, wijst dit op een verschuiving in waar leveranciers op concurreren. Het verkoopargument verschuift van "het schrijft goede code" naar "je kunt erop vertrouwen dat het zelfstandig handelt". Dat is een lastiger te controleren claim, en gepubliceerde benchmarks gaan daar geen uitsluitsel over geven.
Een paar dingen om in de gaten te houden:
- Resultaten van partners. Of Fairwind-partners geverifieerde, echte reparaties van kwetsbaarheden melden, in plaats van scores uit het lab.
- Toegangsbeleid. Of Google de toegang verruimt, en welke waarborgen er gelden bij een bredere uitrol.
- Belangstelling van toezichthouders. Of autonoom patchen de aandacht trekt van toezichthouders die AI-labs al onder de loep nemen.
Op papier ziet het model er sterk uit. De echte test komt pas wanneer partners het op live systemen gaan inzetten.
