Google a anunțat lansarea modelului AI Gemini 4 Argon, disponibil inițial pentru un grup de specialiști în securitate cibernetică prin programul Fairwind. Modelul este conceput pentru a susține procese complexe de raționament în fluxuri de lucru de lungă durată, oferind performanțe de top în inginerie software, activități din mediul enterprise, precum cele din domeniile juridic și financiar și apărare cibernetică.
Funcționalități avansate și performanțe remarcabile
Lansarea în siguranță a unor capabilități avansate necesită o abordare etapizată. Google participă activ la procesul guvernului SUA privind accesul la modele înainte de lansare, extinzând treptat accesul. Prețul inițial pentru model este de 2 dolari pentru un milion de tokenuri de intrare și 10 dolari pentru un milion de tokenuri de ieșire. Tokenurile de intrare stocate în cache vor avea un preț cu 95% mai mic decât cel standard.
Gemini 4 Argon este deja utilizat în fluxurile interne de lucru ale Google, iar mii de angajați au evidențiat punctele forte ale modelului în sarcini specializate de programare, cercetare și redactare. Modelul ajută echipele să dezvolte mai rapid, să crească productivitatea în inginerie și să accelereze progresele în mai multe domenii.
În domeniul calculului cuantic, Argon a optimizat resursele spațiu-timp ale unor subrutine, depășind cu 40% valoarea de referință publicată în doar câteva minute. În ceea ce privește eficiența memoriei, o echipă de agenți Argon a analizat datele de telemetrie privind performanța infrastructurii Google, eliberând peste 300 TiB de memorie, economiile totale fiind estimate între 500 TiB și 1 PiB.
Modelul contribuie la migrarea bazelor de cod C/C++ către Rust în cadrul Google, de la zeci de mii de linii de cod în biblioteci de bază până la peste 800.000 de linii pentru kernelul Fuchsia Zircon. În cazul libgav1, software-ul open-source Google pentru decodare video, agenții Argon au înlocuit 32.000 de linii de cod SIMD, obținând un decodor video sigur care rulează de 2,7 ori mai rapid decât portul anterior.
Google extinde semnificativ limita de tokenuri de ieșire a modelului, de la 64.000 la 1 milion de tokenuri, un nivel de referință în industrie. Acest lucru permite analize profunde și generarea unor volume mari de tokenuri într-un singur proces, atingând un nivel superior de raționament și rezolvând probleme dificile într-o singură sesiune.
Capabilitățile modelului în programare, raționament și multimodalitate îi permit să exceleze într-o gamă largă de fluxuri de lucru din mediul enterprise. Inginerii Google folosesc Argon în activitatea de zi cu zi, de la depanare până la migrări ale bazelor de cod și proiectarea de algoritmi. Modelul stabilește un nou nivel de referință pe DeepSWE v1.1 (77,9%), care măsoară performanța unui model în sarcini reale și de lungă durată de inginerie software.
Argon are cea mai bună performanță în Vals Index, care măsoară impactul economic în domenii precum finanțe, programare, juridic și fiscalitate. În Vals Finance Agent v2, modelul obține scoruri similare, iar în Harvey Legal Agent Benchmark, se remarcă prin performanțe bune în cercetare și redactare juridică. În AutomationBench, Argon ocupă primul loc cu un scor de 51,3%.
Modelul se remarcă și în activitățile profesionale care necesită înțelegerea informațiilor vizuale. În LVBench, care măsoară capacitatea de înțelegere a materialelor video lungi, Argon stabilește un nou nivel de referință, cu un scor de 91,7%.
Pentru a ajuta specialiștii în securitate cibernetică, Google a antrenat Gemini 4 Argon pentru a avea capabilități avansate de apărare cibernetică. Modelul poate identifica, valida și remedia autonom vulnerabilități software critice. Pentru specialiștii de încredere și echipele interne de la Google, Argon va fi fără restricții de siguranță aplicate în mod obișnuit capabilităților cibernetice.
Wiz utilizează deja Argon pentru apărare cibernetică prin inițiativa Scan for Good, un program dedicat protejării gratuite a infrastructurii publice critice. Într-o demonstrație inițială, modelul a descoperit o vulnerabilitate critică în software pentru domeniul medical, identificând un risc grav pe care modelele anterioare nu îl detectaseră.
Pe CWE-bench v1, Argon se află la egalitate pe primul loc cu un scor de 68%, continuând performanțele de top obținute de 3.8 Flash Cyber pe CWE-bench v0.
Gemini 4 Argon înregistrează progrese semnificative în identificarea vulnerabilităților comparativ cu 3.8 Flash Cyber. În benchmark-ul intern Google, Argon a identificat o gamă largă de expuneri în baze de cod complexe, acoperind 20 de limbaje de programare. În benchmark-ul intern Wiz, Argon depășește 3.8 Flash Cyber în identificarea suprafeței de atac și a vulnerabilităților, precum și în generarea de dovezi de tip proof-of-concept.
Înainte de lansarea largă, Google lucrează la măsurile esențiale de siguranță pentru modelele AI avansate în patru direcții principale:
Protecția împotriva utilizării abuzive: Modelul este conceput să refuze solicitările periculoase, permițând în același timp cercetarea științifică legitimă. Măsurile de protecție sunt consolidate prin îmbunătățirea tehnicilor de monitorizare a activărilor interne ale modelului. Aceste măsuri au fost supuse unor teste de robustețe realizate de echipe interne și externe de red teaming.
Protecția împotriva atacurilor de tip prompt injection: Argon este cel mai rezistent model în fața acestor atacuri complexe. Prin red teaming automatizat și antrenament adversarial, modelul înregistrează performanțe de top în ceea ce privește rezistența la atacurile de tip prompt injection în benchmark-ul Indirect Prompt Injection (IPI) al Gray Swan.
Monitorizarea comportamentelor nealiniate: Google are măsuri pentru reducerea riscurilor de nealiniere, monitorizând lanțul de raționament și acțiunile Argon, opresc execuția atunci când este necesar. Un sistem similar monitorizează procesele de antrenare și transmite alerte către o echipă dedicată de răspuns la incidente.
Consolidarea sistemelor: Google folosește mediile izolate de tip sandbox înainte de începerea proceselor de antrenare sau a evaluărilor cu grad ridicat de risc. Google împărtășește aceste bune practici privind securitatea agenților cu partenerii, pentru a contribui la îmbunătățirea securității în întregul ecosistem.
Gemini 4 Argon, cu capabilități avansate în programare, activități profesionale bazate pe cunoaștere, apărare cibernetică și scriere creativă, este un partener pentru dezvoltatori, profesioniști și companii în rezolvarea celor mai dificile probleme.
Oliver Grant
