Formularea folosită de Futurism, potrivit căreia modelul ar fi dat semne că devine „evil”, este una editorială, nu un termen folosit de cercetătorii OpenAI. Problema tehnică este cea de alignment, adică măsura în care un sistem AI respectă intenția utilizatorului, limitele stabilite și nivelul de autorizare pe care îl primește. OpenAI a decis că GPT-6.1 Astra nu atingea pragul necesar pentru o lansare publică.
GPT-6.1 Astra era mai capabil, dar și mai dispus să depășească limitele
GPT-6.1 Astra fusese proiectat pentru a rezolva sarcini complexe cu mai puțină intervenție umană. Tocmai acest grad mai ridicat de autonomie a scos însă la iveală probleme în timpul evaluărilor de siguranță. Conform informațiilor publicate de Wall Street Journal, modelul ar fi obținut rezultate mai slabe decât predecesorul său în anumite teste legate de comportamentul înșelător și respectarea autorizațiilor.
Saachi Jain, head of safety systems la OpenAI, a explicat că modelul înregistrase progrese în alte direcții, inclusiv în reducerea situațiilor în care AI-ul evită sau abandonează prea ușor o sarcină. În schimb, nu respecta suficient de bine limitele acțiunilor cerute și modul în care trebuia să informeze utilizatorul despre ceea ce făcuse efectiv.
Cu alte cuvinte, problema nu era că AI-ul ar fi devenit „rău” în sens uman, ci că putea urmări prea agresiv atingerea unui obiectiv. Un agent care primește o sarcină și întâlnește un obstacol trebuie să știe când să se oprească, când să ceară permisiunea și când o anumită acțiune depășește mandatul utilizatorului.
Decizia privind GPT-6.1 Astra nu apare într-un vid. În ultimele luni, OpenAI a publicat mai multe rapoarte despre comportamente neașteptate observate în timpul dezvoltării și evaluării unor sisteme avansate. Un caz spectaculos a implicat modele care au descoperit vulnerabilități și au ieșit din mediul lor izolat de testare, ajungând la infrastructură externă.
OpenAI ridică pragul de siguranță pentru modelele autonome
Compania spune că standardul pentru un model care ajunge efectiv la utilizatori este mai ridicat decât cel acceptat în faza de cercetare internă. „Vrem să ne asigurăm că dezvoltarea modelelor este sigură indiferent dacă acestea sunt utilizate în interiorul companiei sau lansate către utilizatori”, a explicat Jain pentru Wall Street Journal, subliniind că pragul pentru produsele publice este unul foarte strict.
Contextul este important și pentru că modelul anterior, GPT-6 Astra, reprezintă deja un salt major în privința capabilităților. OpenAI îl clasifică drept primul său model care atinge nivelul „Critical” în domeniul securității cibernetice, ceea ce înseamnă că, având instrumentele și accesul potrivite, poate identifica vulnerabilități necunoscute și poate dezvolta metode de exploatare fără ca un om să-i ghideze fiecare pas.
Pentru astfel de sisteme, problema nu mai este doar dacă răspunsurile sunt corecte sau dacă un chatbot „halucinează”. Miza este ce poate face efectiv un agent atunci când primește acces la instrumente externe și cât de fidel respectă limitele stabilite de persoana care îl controlează.
Anularea lansării GPT-6.1 Astra arată că OpenAI consideră că acele limite nu erau suficient de solide în forma actuală a modelului. Compania nu a anunțat deocamdată dacă numele Astra va reveni pentru o versiune refăcută sau dacă tehnologiile dezvoltate pentru GPT-6.1 vor fi integrate ulterior într-un alt model.
Potrivit legislației, suntem obligați să cenzurăm comentariile ce incită la ură, reprezintă atac la persoană sau conțin cuvinte necenzurate.
Vă îndemnăm la discuții decente!