Compania spune că a luat această măsură după ce a descoperit că modelele sale au exploatat mai multe site-uri web, inclusiv unele care aparțin guvernului american.
Incidentele au apărut, conform unei postări pe blogul companiei, în procesul de testare a agenților AI care căutau resurse online în vederea realizării sarcinilor.
Aceștia au obținut acces la informații profitând de vulnerabilități din bazele de date și spărgând paywall-urile site-urilor de știri, printre altele.
Anthropic menționează și un caz special, în care modelele sale au indus în eroare poliția din Philadelphia în legătură cu o crimă.
Pentru a preveni alte incidente de acest gen, până va fi sigură că poate monitoriza și controla comportamentul acestora, compania americană va realiza evaluările interne ale noilor modele fără acces la internet.
Problemele au fost descoperite în urma unor evaluări care început în luna iulie și care au arătat cât de puțin control are producătorul asupra propriilor modele lingvistice.
Anthropic recunoaște acum că măsurile de aliniament pe care le-a luat au fost insuficiente față de nivelul de sofisticare de care au dat dovadă cele mai noi modele.
Incidentele sunt similare cu cele care au avut în prim-plan modelele OpenAI, doar că Anthropic dă dovadă de ceva mai multă transparență și vine și cu o măsură concretă când le face publice.
















