Home Actualitate Anthropic a lansat public Claude Fable 5...
Actualitate

Anthropic a lansat public Claude Fable 5, primul model AI din clasa Mythos - tehnologia pe care compania o considera până de curând prea periculoasă pentru publicul larg. Cererile riscante sunt redirecționate automat către un model mai vechi

Anthropic, compania americană din spatele asistentului AI Claude, a pus pentru prima dată la dispoziția publicului un model din clasa Mythos - nivelul de capabilitate pe care chiar conducerea companiei îl descria, la începutul anului, drept prea periculos pentru o lansare generală. Noul Claude Fable 5, lansat marți, 9 iunie, vine însă „în lesă": un strat de sisteme AI separate interceptează cerer…

Anthropic a lansat public Claude Fable 5, primul model AI din clasa Mythos - tehnologia pe care compania o considera până de curând prea periculoasă pentru publicul larg. Cererile riscante sunt redirecționate automat către un model mai vechi
Anthropic a lansat public Claude Fable 5, primul model AI din clasa Mythos - tehnologia pe care compania o considera până de curând prea periculoasă pentru publicul larg. Cererile riscante sunt redirecționate automat către un model mai vechi · Foto: Business Magazin

◆ Fable 5 și Mythos 5, lansate simultan pe 9 iunie, au la bază același model – diferența o fac mecanismele de siguranță: „clasificatoare” care redirecționează cererile legate de securitate cibernetică, biologie, chimie și distilare către modelul anterior, Claude Opus 4.8, în medie în sub 5% din sesiuni, potrivit companiei. ◆ Primul model al clasei Mythos a fost ținut din aprilie doar la dispoziția unor parteneri precum Microsoft, Amazon și Cisco, prin Project Glasswing, program derulat în colaborare cu guvernul SUA, după ce a găsit mii de vulnerabilități critice, inclusiv în toate sistemele de operare și browserele majore.◆ Presa specializată în securitate cibernetică rămâne sceptică: modelele AI mai vechi au fost sparte în mod constant de cercetători, iar chiar și modelul de rezervă Opus 4.8 oferă capabilități „dual-use” semnificative, notează publicația americană CyberScoop.

Anthropic, compania americană din spatele asistentului AI Claude, a pus pentru prima dată la dispoziția publicului un model din clasa Mythos – nivelul de capabilitate pe care chiar conducerea companiei îl descria, la începutul anului, drept prea periculos pentru o lansare generală. Noul Claude Fable 5, lansat marți, 9 iunie, vine însă „în lesă”: un strat de sisteme AI separate interceptează cererile pe teme de securitate cibernetică, biologie, chimie sau distilare și le pasează automat modelului anterior, Claude Opus 4.8, utilizatorul fiind informat de fiecare dată.

„Lansarea unui model atât de capabil vine cu riscuri. Fără mecanisme de protecție, capabilitățile Fable 5 în zone precum securitatea cibernetică ar putea fi folosite abuziv pentru a produce daune serioase. Am lansat, prin urmare, modelul cu mecanisme de protecție care fac ca cererile pe anumite subiecte să primească în schimb un răspuns de la următorul nostru cel mai capabil model, Claude Opus 4.8″, se arată în anunțul oficial al Anthropic.

Mecanismul de filtrare – „clasificatoare”, adică sisteme AI separate care detectează potențialele utilizări abuzive, inclusiv tentativele de jailbreak – acoperă trei zone: securitatea cibernetică, biologia și chimia, respectiv distilarea, practica prin care terți încearcă să extragă capabilitățile unui model pentru a antrena modele concurente. Potrivit companiei, redirecționarea către Opus 4.8 se declanșează, în medie, în mai puțin de 5% din sesiuni. „Capabilitățile Fable 5 în zone precum securitatea cibernetică, biologia și chimia sunt suficient de avansate încât adoptăm o abordare deliberat conservatoare pentru aceste subiecte la lansare”, a transmis compania într-un răspuns scris pentru NBC News.
Anthropic recunoaște deschis că a calibrat filtrele mai strâns decât ar fi optim. „Pentru că am prioritizat siguranța, am calibrat deliberat mecanismele de protecție să fie precaute, iar ele sunt încă mai stricte decât ar fi ideal – de exemplu, uneori cereri inofensive vor declanșa clasificatoarele. Recunoaștem că acest lucru va fi frustrant pentru unii utilizatori, iar obiectivul nostru este să reducem alarmele false pe măsură ce actualizăm și rafinăm mecanismele după lansare”, se mai arată în anunț.

De la „prea periculos pentru public” la lansare generală

La începutul acestui an, conducerea Anthropic spunea că noul său model, Claude Mythos, are capabilități atât de puternice de a face rău încât nu îl va lansa public, amintește publicația americană specializată în securitate cibernetică CyberScoop, care își intitulează materialul despre lansare „Mythos în lesă” și descrie noul produs drept o încercare de a împăca discursul de siguranță al companiei cu presiunea pieței.

Primul model al clasei, Claude Mythos Preview, a fost lansat în aprilie exclusiv printr-un program restricționat, Project Glasswing, derulat în colaborare cu guvernul american și deschis unor parteneri precum Microsoft, Amazon și Cisco, care au testat modelul „în spatele ușilor închise”, potrivit publicației britanice IT Pro. Modelul a trimis unde de șoc prin industria securității cibernetice: Mythos Preview a găsit mii de vulnerabilități critice și severe, inclusiv buguri și exploit-uri în toate sistemele de operare și browserele majore, potrivit NBC News. Programul a fost extins săptămâna trecută la peste 150 de organizații – instituții financiare, companii de software și rețele medicale care își testează apărarea cibernetică.

Partenerii Glasswing pot trece de acum la Claude Mythos 5 – același model de bază ca Fable 5, dar cu restricțiile de securitate cibernetică ridicate. „Are cele mai puternice capabilități de securitate cibernetică dintre toate modelele din lume”, susține Anthropic, care spune că va extinde treptat accesul, „în consultare cu guvernul SUA”, printr-un program de acces pe bază de încredere, inclusiv pentru cercetători din științele vieții.

Niciun jailbreak universal – deocamdată

Înainte de lansare, Anthropic a supus filtrele unor teste agresive: un program extern de tip bug bounty nu a produs niciun jailbreak universal – o metodă care ar permite folosirea modelului ca și cum protecțiile nu ar exista – în peste 1.000 de ore de testare, iar organizațiile externe de red-teaming angajate de companie au eșuat la rândul lor, susține Anthropic. Compania admite însă că institutul britanic pentru siguranța AI, UK AISI, „a făcut progrese către” un astfel de jailbreak într-o fereastră scurtă de testare inițială.

„Avansul oferit de capabilitățile de nivel Mythos este valoros pentru mulți adversari – de exemplu, pentru cei care ar putea câștiga financiar din atacuri cibernetice – și ne așteptăm, prin urmare, ca ei să fie motivați să încerce să ocolească măsurile noastre de siguranță”, se arată în anunțul companiei.

Scepticismul rămâne însă prezent în presa de specialitate. CyberScoop notează că cercetătorii în securitate cibernetică au găsit în mod constant metode de a sparge modelele AI mai vechi și că Anthropic nu precizează dacă au fost descoperite tehnici de jailbreak parțiale. În plus, publicația atrage atenția că nici varianta de rezervă nu este inofensivă: potrivit documentației tehnice a Opus 4.8 citate de CyberScoop, fără mecanisme de protecție, modelul de fallback poate reproduce circa 80% din vulnerabilitățile descoperite anterior în proiecte software open-source reale, pornind de la o descriere generală a slăbiciunii – protecțiile reduc această rată la 1%.

Ce poate modelul – și cât costă

Dincolo de zonele blocate, Anthropic susține că Fable 5 depășește orice model pus vreodată de companie la dispoziția publicului și că este state-of-the-art pe aproape toate benchmark-urile testate. Pe SWE-Bench Pro, un test de sarcini reale de inginerie software, modelul atinge 80,3%, față de 69,2% pentru Opus 4.8, 58,6% pentru GPT 5.5 și 54,2% pentru Gemini 3.1 Pro, potrivit datelor prezentate de companie și preluate de publicația germană The Decoder. În testele de acces timpuriu, procesatorul de plăți Stripe a raportat că modelul a realizat într-o singură zi o migrare a unui cod-sursă de 50 de milioane de linii, operațiune care ar fi luat manual unei echipe întregi peste două luni, susține Anthropic.

Compania face afirmații ambițioase și în zona științifică: experții săi interni ar fi accelerat de circa 10 ori etape ale procesului de design de medicamente cu ajutorul Mythos 5. Anthropic mai susține că Mythos 5 este primul său model care produce „în mod consecvent ipoteze științifice noi, convingătoare” – o afirmație pe care The Decoder o plasează în contextul unei dezbateri deschise în industrie, capacitatea modelelor de limbaj de a face știință reală fiind contestată, printre alții, de Richard Sutton, laureat al premiului Turing.

Noua generație vine și cu un preț pe măsură: 10 dolari per milion de tokeni la intrare și 50 de dolari per milion la ieșire – dublu față de Opus 4.8 (5, respectiv 25 de dolari), deși compania îl prezintă ca fiind „sub jumătate” din prețul la care a fost oferit Mythos Preview.

Fable 5 este inclus fără cost suplimentar în abonamentele Pro, Max, Team și Enterprise până pe 22 iunie; de pe 23 iunie, accesul va necesita credite de utilizare, compania promițând revenirea în abonamente „când capacitatea o va permite”. „Ne așteptăm ca cererea pentru Fable 5 să fie foarte mare și greu de prezis”, se arată în anunț.

Lansarea vine la pachet și cu o schimbare de politică a datelor: tot traficul către modelele din clasa Mythos va fi păstrat obligatoriu timp de 30 de zile, inclusiv pe platformele terțe și inclusiv pentru clienții enterprise care aveau anterior acorduri de tip „retenție zero”, notează TechCrunch, care avertizează că politica „ar putea crea un precedent de industrie”. Compania susține că datele nu vor fi folosite la antrenarea modelelor, ci exclusiv pentru apărarea împotriva atacurilor noi și reducerea blocărilor eronate. Măsura se aliniază ordinului executiv semnat cu o săptămână înainte de președintele american Donald Trump, care creează un mecanism voluntar de partajare a modelelor AI de frontieră cu guvernul, pentru testare de siguranță înainte de lansare, potrivit NBC News.

Momentul lansării nu este întâmplător nici din perspectivă financiară: Anthropic a depus confidențial dosarul pentru listarea la bursă, după o rundă de finanțare care a evaluat compania la 965 mld. de dolari, iar rivalul OpenAI a depus propriul dosar cu o zi înainte, ambele operațiuni fiind estimate printre cele mai mari IPO-uri din istorie. Cu doar câteva zile înainte de lansare, Anthropic ceruse public marilor laboratoare AI să stabilească o „frână coordonată” a dezvoltării modelelor de frontieră, avertizând că sistemele ar putea ajunge curând să se auto-îmbunătățească fără intervenție umană, notează TechCrunch.

Conţinut Business Magazin
Citeşte fără limită restul articolelor cu plată
Abonează-te — 9,90 € / lună