Google a anunțat noul model Gemini 4 Argon
Reading Time: 7 minuteGoogle a anunțat Gemini 4 Argon, noul model AI de ultimă generație, disponibil în prima etapă pentru un grup de specialiști de încredere în securitate cibernetică, prin programul Fairwind. Conceput pentru a susține procese aprofundate de raționament în cadrul unor fluxuri de lucru complexe și de lungă durată, Argon schimbă fundamental modul în care lucrăm. Modelul oferă performanțe de top în fluxuri de lucru complexe, de la inginerie software în contexte reale și activități specializate din mediul enterprise, precum cele din domeniile juridic și financiar, până la apărarea cibernetică.
Lansarea în siguranță a unor capabilități avansate de acest nivel necesită o abordare etapizată. Google participă activ la procesul voluntar al guvernului SUA privind accesul la modele înainte de lansare, în timp ce extindem treptat accesul.
Argon va fi lansat la un preț inițial de 2 dolari 1 pentru un milion de tokenuri de intrare și 10 dolari pentru un milion de tokenuri de ieșire. Pentru tokenurile de intrare stocate în cache, prețul va fi cu 95% mai mic decât cel standard pentru tokenurile de intrare.
Schimbăm modul în care lucrăm și dezvoltăm produse la Google
Gemini 4 Argon este deja utilizat în fluxurile Google interne de lucru, iar mii de angajați Google au evidențiat punctele forte ale modelului în sarcini specializate de programare, cercetare aprofundată și redactare. Argon ajută echipele să dezvolte mai rapid, să crească productivitatea în inginerie și să accelereze progresele în mai multe domenii:
- Optimizarea algoritmilor cuantici: Argon îi ajută pe cercetătorii noștri din domeniul calculului cuantic să optimizeze resursele spațiu-timp (qubiți × porți) ale subrutinelor care limitează performanța unor aplicații importante. Într-unul dintre cazuri, a depășit cu 40% valoarea de referință publicată, în doar câteva minute.
- Eficiența memoriei: O echipă de agenți Argon a analizat datele de telemetrie privind performanța întregii infrastructuri pentru a identifica și aplica în mod autonom optimizări ale memoriei în centrele de date Google. Odată implementate, acestea au eliberat peste 300 TiB de memorie, economiile totale fiind estimate între 500 TiB și 1 PiB.
- Migrări și optimizări ale bazelor de cod la scară largă: Agenții Argon contribuie la migrarea bazelor de cod C/C++ către Rust în cadrul Google, de la zeci de mii de linii de cod în biblioteci de bază precum re2 și libgav1 până la peste 800.000 de linii pentru kernelul Fuchsia Zircon. Având în vedere rolul critic al multora dintre aceste sisteme, astfel de rescrieri la scară largă sunt supuse unor procese riguroase de audit automat și manual, testare prin emulare și verificare înainte de implementarea în producție.
În cazul libgav1, software-ul open-source Google pentru decodare video, agenții Argon au pornit de la un port existent în Rust și au înlocuit 32.000 de linii de cod SIMD, efectuând numeroase runde de experimente ghidate de profilarea performanței, analizând rezultatele compilatorului și generând cod Rust sigur, astfel încât compilatorul să îl poată vectoriza automat. Rezultatul este un decodor video sigur din perspectiva gestionării memoriei, care rulează de 2,7 ori mai rapid decât portul Rust anterior și produce un rezultat video identic, apropiindu-se astfel de performanța versiunii C++ optimizate.
Mai multă putere pentru cele mai complexe probleme
Pentru a susține capabilitățile Gemini 4 Argon în scenarii de utilizare mai lungi și mai complexe, Google extinde semnificativ limita de tokenuri de ieșire a modelului, de la 64.000 la 1 milion de tokenuri, un nivel de referință în industrie. Atunci când modelul are suficientă capacitate pentru a analiza în profunzime și a genera sute de mii de tokenuri într-un singur proces, poate atinge un nivel superior de profunzime a raționamentului și poate rezolva probleme dificile într-o singură sesiune.

Programare și fluxuri de lucru enterprise în mai multe domenii
Capabilitățile Gemini 4 Argon în programare, raționament și multimodalitate, precum și capacitatea sa de a gestiona sarcini complexe, desfășurate în mai multe etape și pe perioade mai lungi, îi permit să exceleze într-o gamă largă de fluxuri de lucru din mediul enterprise.
Inginerii Google folosesc Argon în activitatea de zi cu zi, de la depanarea uzuală până la migrări ale bazelor de cod la scară largă și proiectarea de algoritmi. Modelul stabilește un nou nivel de referință pe DeepSWE v1.1 (77,9%), care măsoară performanța unui model în sarcini reale și de lungă durată de inginerie software.
Dincolo de programare, Argon este modelul cu cea mai bună performanță în Vals Index, care măsoară impactul economic în domenii precum finanțe, programare, juridic și fiscalitate, fiecare sector fiind ponderat în funcție de contribuția sa la PIB-ul SUA. Vedem performanțe similare și în alte evaluări specifice anumitor domenii, precum Vals Finance Agent v2, care evaluează cercetarea financiară în mai multe etape, și Harvey’s Legal Agent Benchmark, dedicat cercetării și redactării juridice. În AutomationBench, benchmark-ul Zapier care măsoară executarea integrală a sarcinilor din principalele funcții de business, Argon ocupă primul loc, cu un scor de 51,3%.
Argon se remarcă și în activitățile profesionale care necesită înțelegerea informațiilor vizuale. Modelul poate realiza analize profesioniste ale graficelor, poate identifica detalii din materiale video de lungă durată și poate acționa pe baza informațiilor dintr-o serie de documente. De exemplu, în LVBench, care măsoară capacitatea de înțelegere a materialelor video lungi, Argon stabilește un nou nivel de referință, cu un scor de 91,7%.

Performanțe de top în apărarea cibernetică
Pentru a-i ajuta mai bine pe specialiștii în securitate cibernetică să facă față unei noi generații de atacuri, Google a antrenat Gemini 4 Argon pentru a avea capabilități avansate de apărare cibernetică. Argon poate identifica, valida și remedia în mod autonom vulnerabilități software critice. Pentru specialiștii de încredere în securitate cibernetică și pentru echipele interne de la Google, Argon va fi fără restricțiile de siguranță aplicate în mod obișnuit capabilităților cibernetice, astfel încât aceștia să îi poată utiliza întregul potențial avansat pentru apărarea cibernetică.
Wiz utilizează deja Argon pentru apărare cibernetică prin inițiativa Scan for Good, un program dedicat protejării gratuite a infrastructurii publice critice prin identificarea și remedierea expunerilor cu risc ridicat. Într-o demonstrație inițială a impactului său, modelul a descoperit o vulnerabilitate critică ce expunea informații personale sensibile în software pentru domeniul medical utilizat de spitale din întreaga lume, identificând un risc grav pe care modelele avansate anterioare nu îl detectaseră.
Pe CWE-bench v1, care evaluează capacitatea unui model de a remedia vulnerabilități de securitate, Argon se află la egalitate pe primul loc, cu un scor de 68%, continuând performanțele de top obținute de 3.8 Flash Cyber pe CWE-bench v0.

Gemini 4 Argon înregistrează progrese semnificative în identificarea vulnerabilităților comparativ cu 3.8 Flash Cyber. De exemplu:
- În benchmark-ul intern Google pentru evaluarea cuprinzătoare a vulnerabilităților, Argon a identificat o gamă largă de expuneri în baze de cod complexe, care acoperă 20 de limbaje de programare.
- În benchmark-ul intern Wiz pentru testarea de penetrare de tip black-box, care evaluează capacitatea unui model de a analiza sisteme web active fără acces la codul-sursă, Argon depășește 3.8 Flash Cyber în identificarea suprafeței de atac și a vulnerabilităților, precum și în generarea de dovezi de tip proof-of-concept pentru validarea acestora.

Consolidarea măsurilor de siguranță înainte de disponibilitatea pe scară largă
Înainte de a pune Gemini 4 Argon la dispoziție pe scară largă, Google lucrează la măsurile esențiale de siguranță pentru modelele AI avansate în patru direcții principale:
Protecția împotriva utilizării abuzive: Pentru a împiedica actorii rău intenționați să folosească Argon pentru atacuri cibernetice sau chimice, biologice, radiologice și nucleare (CBRN), modelul este conceput să refuze solicitările periculoase, permițând în același timp cercetarea științifică legitimă cu dublă utilizare, în conformitate cu Frontier Safety Framework. Pentru această lansare, consolidează robustețea măsurilor de protecție, inclusiv prin îmbunătățirea tehnicilor de monitorizare a activărilor interne ale modelului pentru identificarea tentativelor de utilizare abuzivă. Aceste măsuri au fost supuse unor teste de robustețe realizate de echipe interne și externe de red teaming, folosind o combinație de metode de atac manuale și automatizate.
Protecția împotriva atacurilor de tip prompt injection: Argon este și cel mai rezistent model de până acum în fața atacurilor indirecte de tip prompt injection, în care instrucțiuni sau contexte malițioase sunt folosite pentru a deturna comportamentul unui model. Acestea sunt atacuri complexe, care necesită vigilență permanentă și mai multe niveluri de protecție. Prin red teaming automatizat și antrenament adversarial, Gemini 4 Argon înregistrează performanțe de top în ceea ce privește rezistența la atacurile de tip prompt injection în benchmark-ul Indirect Prompt Injection (IPI) al Gray Swan.

Monitorizarea comportamentelor nealiniate: Pentru a preveni situațiile în care Argon ar putea depăși limitele unei sarcini, încercând să o îndeplinească într-un mod care depășește intențiile utilizatorului, Google are măsuri pentru reducerea riscurilor de nealiniere, care monitorizează lanțul de raționament și acțiunile Argon și opresc execuția atunci când este necesar.
Uun sistem similar pentru monitorizarea proceselor de antrenare și pentru transmiterea de alerte către o echipă dedicată de răspuns la incidente, luând măsuri atente pentru ca rezultatele monitorizării să nu fie reintroduse în procesul de antrenare și să nu existe astfel riscul ca Argon să învețe să își adapteze raționamentul pentru a evita monitorizarea. Încurajăm ferm restul industriei să păstreze transparența proceselor de raționament în aceste momente importante, în care capabilitățile modelelor cresc și trebuie gestionate riscurile de aliniere, astfel încât procesele de raționament ale modelelor să rămână utile pentru identificarea și diagnosticarea comportamentelor nealiniate.
Consolidarea sistemelor: Pe măsură ce modelele AI avansate devin tot mai capabile, testarea lor în condiții de siguranță necesită medii securizate care să țină pasul cu evoluția sistemelor. În conformitate cu foaia noastră de parcurs privind controlul agenților, Google folosește mediile izolate de tip sandbox prin izolarea și securizarea acestora înainte de începerea proceselor de antrenare sau a evaluărilor cu grad ridicat de risc. Google împărtășește aceste bune practici privind securitatea agenților cu partenerii, pentru a contribui la îmbunătățirea securității în întregul ecosistem.
Disponibil în curând
Gemini 4 Argon cu capabilități avansate în programare, activități profesionale bazate pe cunoaștere, apărare cibernetică și scriere creativă, pentru a fi un partener pentru dezvoltatori, profesioniști și companii în rezolvarea celor mai dificile probleme.
Urmăriți Revista Biz și pe Google News. Abonamente Revista Biz


