Protecțiile AI dezvoltate de Meta și Google pot fi eliminate în câteva minute: Mii de versiuni modificate circulă deja online și răspund la solicitări extrem de periculoase
Instrumente software care elimină sistemele de protecție integrate în modelele de inteligență artificială dezvoltate de companii precum Meta și Google sunt folosite pentru a crea mii de versiuni modificate ale acestor sisteme, lipsite de restricțiile originale de siguranță, informează Financial…
Instrumente software care elimină sistemele de protecție integrate în modelele de inteligență artificială dezvoltate de companii precum Meta și Google sunt folosite pentru a crea mii de versiuni modificate ale acestor sisteme, lipsite de restricțiile originale de siguranță, informează Financial Times.
Potrivit unor teste realizate de FT împreună cu grupul de siguranță AI Alice, modelele modificate au oferit răspunsuri la solicitări legate de arme biologice, malware și exploatarea sexuală a copiilor.
O versiune modificată a modelului open-source Gemma 3 de la Google a răspuns la întrebări privind dispersarea unui gaz nociv într-un spațiu aglomerat, a generat cod pentru furtul informațiilor de pe carduri bancare și a produs texte care descriau abuzuri sexuale asupra minorilor.
Dezvăluirile amplifică temerile legate de dificultatea controlării sistemelor AI open-source pe măsură ce acestea devin tot mai performante.
Cercetătorii avertizează că problema s-a agravat odată cu creșterea capacităților modelelor de ultimă generație. În aprilie, Anthropic susținea că modelul său Claude Mythos identificase vulnerabilități în aproape toate marile sisteme de operare și browsere web.
Experții spun că răspândirea modelelor modificate complică eforturile guvernelor și companiilor de a reglementa AI-ul direct la sursă, deoarece aceste sisteme pot fi copiate, descărcate și alterate în afara controlului creatorilor lor.
Companiile din domeniu au investit miliarde pentru dezvoltarea unor mecanisme de protecție, așa-numitele „guardrails”, menite să împiedice utilizările periculoase ale inteligenței artificiale.
Totuși, tehnici precum cea numită „abliteration” permit eliminarea rapidă a acestor protecții din modelele open-source, care pot fi descărcate și modificate liber de dezvoltatori.
Astfel de metode sunt mult mai dificil de aplicat sistemelor proprietare precum ChatGPT sau Claude, deoarece codul lor intern nu este accesibil publicului.
În schimb, modelele open-source reduc constant diferența față de sistemele comerciale avansate, uneori în doar șase până la douăsprezece luni.
Financial Times a relatat că a reușit să folosească un instrument disponibil public pe GitHub pentru a elimina restricțiile modelului Llama 3.3 dezvoltat de Meta.
Versiunea modificată a răspuns ulterior la întrebări pe care modelul original le refuza, inclusiv solicitări legate de substanțe toxice precum ricina.
Potrivit publicației, întregul proces nu a necesitat hardware specializat, a folosit instrumente gratuite și a fost realizat în mai puțin de zece minute.