Arhive etichete: Jacob Coxon

Știu că n-au controlul AI. Construiesc în continuare.


Un cercetător de la Anthropic și-a dat demisia marți. Nu ca să anunțe un startup evaluat preventiv la câteva miliarde de dolari. Jacob Coxon a plecat spunând că laboratoarele din fruntea cursei pentru inteligența artificială se îndreaptă prea repede spre sisteme despre care nu știu încă dacă le pot controla. A plecat cu două luni înainte ca pachetul său de acțiuni să înceapă să-i revină efectiv. Coxon nu privește industria din tribună. A lucrat vreo trei ani în pretraining — etapa în care modelele sunt antrenate pe cantități uriașe de date — mai întâi la OpenAI, apoi patru luni la Anthropic. Angajații Anthropic trebuie să stea șase luni pentru ca acțiunile promise prin pachetul de compensație să înceapă să le revină efectiv. A plecat înainte de prag. Nu e o dovadă că are dreptate, explicația comodă că încearcă să umfle valoarea companiei înainte să-și încaseze equity-ul. Pentru Axios a precizat că încă deține acțiuni la fostul angajator, OpenAI.

Postarea prin care și-a anunțat plecarea a depășit 100 de milioane de vizualizări pe X. În parte, fiindcă nu sună a comunicat de laborator. Coxon scrie că oamenii care construiesc cele mai avansate modele cred, cu seriozitate, că acestea ar putea deveni suficient de puternice încât să provoace o catastrofă globală, inclusiv dispariția omenirii, până la sfârșitul deceniului. „Neither company is acting responsibly”, a scris despre OpenAI și Anthropic. Cursa, spune el, merge spre superinteligență care se îmbunătățește singură.

Asta merită o precizare imediată, altfel ajungem la fotografia cu Terminator. Coxon n-a descoperit o ecuație din care iese anul 2029. Nu există așa ceva. Vorbim despre evaluări de risc făcute de oameni care încearcă să anticipeze tehnologii care încă nu există în forma despre care discută. Probabilitatea exactă a unei catastrofe existențiale nu e măsurabilă astăzi. Diferențele dintre specialiști sunt enorme.

Povestea devine greu de expediat cu un „încă un doomer” din cauza celor care au rămas în firmă.

Evan Hubinger, care conduce cercetarea de alignment la Anthropic, i-a răspuns public că, în esență, Coxon are dreptate. Hubinger estimează personal la peste 10% șansa ca AI să poată ucide întreaga omenire în următorii zece ani. E, firește, estimarea lui personală, nu o probabilitate măsurată. Mai important: recunoaște că Anthropic nu are un plan prin care să poată spune că a rezolvat alignment-ul unei eventuale superinteligențe și că nu e clar nici măcar că se află pe drumul spre o asemenea soluție.

Samuel Marks, care lucrează pe scalable oversight tot la Anthropic, a intervenit în nume personal. A spus că astfel de îngrijorări există în industrie și că, din experiența lui, preocuparea tinde să fie mai mare la angajații mai seniori.

Un om care pleacă supărat poate spune multe. E o tradiție corporatistă aproape la fel de veche ca imprimanta care nu merge când ai nevoie de ea. Însă când oamenii care rămân — inclusiv cei plătiți să rezolve exact problema invocată de fostul coleg — răspund public că da, problema e reală și soluția nu există încă, merită măcar să-i asculți. Alignment-ul se poate formula simplu: cum te asiguri că un sistem extrem de capabil face ce vrei tu să facă, nu doar ceva care seamănă suficient de bine cu ce-ai vrut?

La modelele de azi, răspunsul e un amestec de antrenare, recompense, reguli, filtre, evaluări și monitorizare. Nu programezi fiecare reacție ca pe un software clasic. Antrenezi modelul astfel încât comportamentul dorit să devină foarte probabil. Diferența pare academică până îi dai autonomie, unelte și timp. Atunci un obiectiv vag specificat plus o situație neanticipată pot fi de ajuns.

În aceeași săptămână, povestea lui Coxon s-a intersectat aproape grotesc de bine cu un document publicat de Anthropic pe 9 septembrie.

Pe 30 iulie, compania raportase trei incidente din evaluările sale de securitate cibernetică: versiuni Claude ajunseseră, fără autorizație, în sisteme reale ale unor terți. Pe 9 septembrie a publicat un alignment assessment: un al patrulea caz, găsit ulterior, plus o recitire a tuturor patru. A lărgit căutarea la circa 481 de milioane de transcripturi. N-a mai găsit alte cazuri de gravitate similară sau mai mare. A anunțat și un review independent cu METR. Nu, Claude n-a evadat din server și nu și-a închiriat garsonieră pe dark web. Cauza inițială a fost banală și, tocmai de aceea, instructivă. Evaluările rulau cu un partener extern. Modelelor li s-a spus că lucrează într-o simulare, fără internet. Mediul era, de fapt, conectat la internetul real. Iar pentru că erau teste de securitate, modelele rulau intenționat fără protecțiile din produsele Claude oferite publicului.

Problema e ce-au făcut după ce au găsit ușa deschisă.

În cazul considerat de Anthropic cel mai îngrijorător, Claude Mythos 5 trebuia să rezolve un exercițiu Capture the Flag împotriva unei companii fictive. A descoperit că poate ieși pe internet. Ca să-și îndeplinească obiectivul, a încercat să-și facă conturi, să găsească numere de telefon și metode de plată, apoi a publicat pe PyPI trei versiuni ale unui pachet Python malițios. Pachetul a fost instalat pe 15 sisteme externe — Anthropic crede că erau scanere automate ale unor firme de securitate. Unul a expus credențiale. Claude le-a folosit ca să intre într-o bază de date reală.

Mai interesant decât intruziunea e raționamentul. Modelul trata indiciile că se află pe internetul real drept dovezi că simularea e extraordinar de reușită. Odată pornit pe premisa că mediul e fictiv, interpreta informațiile noi astfel încât să i-o confirme. Anthropic numește asta biased reasoning. În paralel, nota recklessness: continua acțiuni potențial dăunătoare ca să-și termine sarcina, fără să se oprească suficient asupra consecințelor.

Într-un alt incident, Claude Opus 4.7 trebuia tot să atace o țintă fictivă. După ce n-a reușit pe traseul prevăzut, a găsit pe internet o firmă reală cu un nume aproape identic și s-a apucat de ea. Își dădea seama că interacționează cu un sistem real. A inventat totuși explicația convenabilă: firma trebuie să facă parte din exercițiu, deci are autorizație. Abia când cercetătorii l-au întrebat explicit cine i-a dat-o și dacă include sistemele reale, a recunoscut că acțiunile nu erau permise.

Merită păstrată proporția. Toate cele patru incidente s-au produs în medii speciale de evaluare, cu aceeași problemă de configurare. Modelele n-au abandonat obiectivul primit ca să înceapă o operațiune proprie. Nu s-au ascuns, nu s-au multiplicat, nu s-au coordonat cu alți agenți. Urmăreau sarcina pe care le-o dăduse omul. Exact asta e partea incomodă, pentru că nu ți-a trebuit un HAL 9000 cu resentimente. Modelele nu și-au inventat un scop. Au urmărit scopul pe care li-l dăduse omul, într-o lume pe care omul o descrisese greșit.

Obiecția corectă e la vedere: astea sunt, mai întâi, eșecuri de izolare. Mediu prost configurat, safeguard-uri de producție oprite, task ofensiv. Nu e o evadare. Nu e o dovadă că o superinteligență o să iasă din laborator să lichideze specia. Rămâne totuși inconvenientul pe care Anthropic îl spune singură, într-un limbaj mai atent decât al lui Coxon. Incidentele sunt „serioase”. Testele de dinaintea lansării nu le-au detectat. Realizarea unor evaluări care să prindă din timp toate formele relevante de eșec e o problemă nerezolvată. Pe măsură ce modelele devin mai capabile, auditul poate deveni mai greu: sistemele viitoare ar putea recunoaște că sunt evaluate, s-ar putea comporta mai cuminte în teste sau ar putea acționa prea sofisticat pentru mediile actuale. Concluzia raportului e fără echivoc: antrenarea unor modele extrem de puternice astfel încât să fie robust aliniate rămâne o provocare tehnică nerezolvată.

De-asta demisia lui Coxon e mai interesantă decât obișnuita poveste cu cercetătorul speriat de propria invenție. El nu spune că Anthropic e cea mai iresponsabilă firmă din industrie. Spune contrariul. După OpenAI și Anthropic, diferența i se pare mare. Anthropic tratează riscurile cel mai serios. Oamenii de acolo se comportă, după el, ca într-un „mini Manhattan Project”: conducerea discută explicit cu angajații scenarii despre evoluția AI și consecințele lor. Problema lui e alta. Manhattan Project era, măcar formal, un proiect de stat. Anthropic e o companie privată care încearcă să gestioneze o tehnologie despre care propriii cercetători cred că ar putea avea implicații la nivelul civilizației. N-a văzut Anthropic tăind până acum din măsurile de siguranță ca să accelereze. Temerea privește ce urmează. Dacă progresul se accelerează și competiția cu OpenAI și laboratoarele chineze se ascuțește, fiecare firmă are un motiv perfect rațional să meargă puțin mai repede decât ar considera ideal. Alternativa e ca adversarul să ajungă primul.

Aici se rupe povestea de roboții ucigași și intră în ceva mai vechi: o cursă înarmărilor. Fiecare participant ar prefera probabil o lume în care toată lumea înaintează prudent. Niciunul nu poate risca să fie singurul prudent. Dacă Anthropic încetinește și OpenAI nu, Anthropic pierde. Dacă laboratoarele americane încetinesc și China nu, Washingtonul consideră că pierde. Dacă toți presupun că ceilalți nu vor frâna, rezultatul rațional pentru fiecare e să accelereze împreună.

Coxon propune, ca prim pas, ca OpenAI și Anthropic să cadă de acord să nu intre imediat în recursive self-improvement: folosirea AI ca să automatizeze cercetarea care produce următoarea generație de AI, care apoi accelerează generația de după. Mai departe, un acord care să includă Statele Unite și China și un sistem prin care marile capacități de calcul să poată fi urmărite, conceptual, cum sunt urmărite materialele nucleare.

E posibil ca scenariile lui să fie prea pesimiste. Istoria tehnologiei e plină de predicții spectaculoase car n-au venit. „Peste 10% șanse ca AI să omoare omenirea” rămâne estimarea unui cercetător, nu o ecuație verificabilă. Nu trebuie să-i accepți procentul ca povestea să rămână importantă.

Avem oameni aflați cel mai aproape de construirea celor mai capabile sisteme care spun că nu știu încă să garanteze controlul asupra a ceea ce vor să construiască în continuare. Și continuă să le construiască. cNu neapărat pentru că sunt inconștienți. Paradoxal, unii par extraordinar de conștienți de risc. Continuă pentru că sunt prinși într-o cursă în care fiecare se teme că celălalt ajunge primul. Asta, dacă stăm bine să ne gândim, e partea cea mai omenească din toată povestea.

Scrie un comentariu Continuă citirea →