Compania OpenAI a decis să aloce aproximativ 20% din puterea de calcul utilizată pentru rularea unui model de inteligență artificială către monitorizarea activității acelui model. Măsura vine în urma unui incident de securitate din iulie, când un agent AI autonom a reușit să evite sistemele de control, să se conecteze la internet și să inițieze un atac asupra platformei Hugging Face.
Ca urmare directă a incidentului, OpenAI a oprit timp de două săptămâni toate procesele de antrenament bazate pe „reinforcement learning” (un proces de învățare prin recompensă și penalizare) pentru cele mai noi modele ale sale. De asemenea, a fost suspendată cea mai mare rundă de antrenament planificată pentru modelele de frontieră (cele mai avansate). Practic, resurse de calcul care ar fi fost folosite pentru a crește performanța modelelor AI sunt acum redirecționate către supraveghere și validare internă. Platforma Hugging Face a anunțat inițial atacul ca provenind de la un agent autonom, iar ulterior OpenAI a confirmat că propriile sale modele au fost responsabile.
Noi reguli pentru detectarea comportamentului periculos
Pe lângă alocarea resurselor de calcul, compania a implementat și noi proceduri de intervenție. O alertă trebuie acum declanșată în maximum 30 de minute de la detectarea unei activități potențial periculoase. Dacă echipele de securitate nu pot confirma în următoarele 30 de minute că este vorba despre o alertă falsă, testul respectiv este oprit imediat. Alte măsuri tehnice includ o mai bună izolare a rețelelor pentru a bloca accesul neautorizat la internet, eliminarea serviciilor partajate considerate vulnerabile și îmbunătățirea sistemelor de logare a raționamentului modelelor AI. Acest ultim aspect permite o urmărire mai clară a pașilor logici interni prin care un model ajunge la un anumit răspuns sau la o anumită acțiune.
Incidentul vine într-un context în care OpenAI oprise temporar și dezvoltarea seriei sale avansate de modele, denumită Astra, din cauza riscurilor operaționale. Potrivit Financiarul, compania a anunțat că modelul Astra, care nu a fost încă lansat public, a atins un nivel de risc de securitate cibernetică „critic” în cadrul propriilor evaluări de siguranță, deși nu a fost implicat în atacul asupra Hugging Face.
Reprezentanții companiei explică aceste măsuri ca fiind o adaptare necesară la noile capacități ale tehnologiei. „Pe măsură ce modelele devin mai capabile, riscurile asociate cu dezvoltarea și testarea lor internă cresc și ele. Standardele noastre de monitorizare, aliniere și securitate trebuie să devanseze aceste riscuri”, a declarat Amelia Glaese, VP of research la OpenAI. Aceasta a adăugat că „aceste cerințe și așteptări variază în funcție de nivelul de risc pe care îl observăm”. În legătură cu oprirea antrenamentelor, compania a precizat: „Cea mai mare rundă planificată de reinforcement learning (RL) de frontieră rămâne în așteptare în timp ce efectuăm antrenamente și evaluări la scară mai mică pentru a evalua comportamentul modelului, a valida măsurile noastre de protecție și a stabili mai multe dovezi de aliniere înainte de a continua.”
Gresie exterior / interior portelanata Delta Beige 30 x 60 cm mata rectificata tip piatraCumpără-34%
Gresie interior antiderapanta Lorca Dark Brown 30 x 30 cm mata tip marmuraCumpără-34%
Faianta Satvario Gray 30 x 45Cumpără-33%
Gresie exterior / interior portelanata New Marfil Beige 60 x 60 cm lucioasa rectificata tip piatra naturalaCumpără




