Undeva în întinderea de depozite din America, cotoarele cărților erau tăiate de mașini ca niște bucăți de salam. Scanerele procesau apoi conținutul în bloc. În câteva milisecunde, o lucrare care ar fi putut fi produsă de oameni în ani de zile era încărcată în eterul digital și folosită ulterior pentru a antrena modele de inteligență artificială să reproducă vocea și structura limbilor noastre, relatează The Guardian.
De acolo, hârtia devenea deșeu, care era transportat către fabricile de reciclare pentru a fi transformat în celuloză și reutilizat în produse precum hârtie igienică și cutii de carton.
Proiectul Panama a fost planul secret al Anthropic „de a scana distructiv toate registrele contabile din lume”, un document de planificare intern dezvăluit în documente legale la sfârșitul lunii iulie.
„Nu vrem să se știe că lucrăm la asta”, se arată în document.
Dezvăluirea eforturilor obscure ale Anthropic a aruncat o nouă lumină asupra cursei pentru dezvoltarea inteligenței artificiale.
Proiectul Panama a început la începutul anului 2024, deoarece directorii Anthropic au căutat cărți anterioare celor disponibile online, care l-ar putea învăța pe chatbot-ul lor cu inteligență artificială, Claude, „cum să scrie bine” în loc să imite „limbajul de calitate inferioară al internetului”, conform unor documente recent publicate.
Startup-ul a achiziționat zeci de mii de cărți simultan de la mai mulți furnizori, inclusiv Better World Books și World of Books, cu sediul în Marea Britanie.
Apoi a externalizat munca grea de scanare și distrugere a cărților către un furnizor, care a folosit o mașină hidraulică pentru a tăia cotoarele și a felia paginile una câte una, astfel încât acestea să poată fi copiate și încărcate rapid folosind echipamente industriale de imagistică.
Potrivit unui furnizor care a colaborat în cele din urmă cu Anthropic, compania „căuta un furnizor cu experiență în servicii de scanare a documentelor pentru a converti de la 500.000 la două milioane de cărți pe o perioadă de șase luni”.
Documentele interne de planificare sugerează că directorii Anthropic credeau că inițiativa va duce la o comunicare de calitate superioară și va aborda colapsul modelului de inteligență artificială – un tip de degradare care apare atunci când inteligența artificială se antrenează pe text contaminat de propriul rezultat.
Spre deosebire de o mare parte a internetului modern, cărțile oferă cantități vaste de literatură scrisă de oameni și editată profesional, care nu a fost însă afectată de conținut generat de inteligența artificială.
Provocarea pentru companiile de inteligență artificială era cum să le obțină. Însă documentele depuse la instanță sugerează că directorii Anthropic ar fi putut crede că pot scăpa nepedepsiți și, chiar dacă nu ar fi putut, că scopul ar justifica mijloacele.
Conform unei declarații, cofondatorul Anthropic, Ben Mann, a achiziționat o colecție de conținut protejat prin drepturi de autor dintr-o „bibliotecă din umbră” numită LibGen în iunie 2021. Declarația includea chiar și o captură de ecran a browserului web al lui Mann în procesul de descărcare a cărților piratate.
Proiectul Panama a devenit public doar prin intermediul a mii de pagini de documente judiciare dezvăluite într-un proces privind drepturile de autor intentat de un grup de autori, care au susținut că Anthropic le-a folosit ilegal lucrările pentru a-l instrui pe Claude.
În 2024, un grup de autori, condus de romanciera Andrea Bartz și scriitorii de non-ficțiune Charles Graeber și Kirk Wallace Johnson, au intentat un proces colectiv împotriva Anthropic, susținând că firma a încălcat legile privind drepturile de autor prin utilizarea de cărți piratate pentru a-și antrena modelul de inteligență artificială.
Luna trecută, Anthropic – evaluată în prezent la 965 de miliarde de dolari americani – a fost de acord să plătească 1,5 miliarde de dolari pentru a soluționa cazul, acoperind aproximativ 500.000 de lucrări eligibile.
„Este cea mai mare recuperare de drepturi de autor cunoscută din istorie”, a declarat Justin Nelson, avocatul principal al autorilor.
Meta, OpenAI, Google și Microsoft se confruntă, de asemenea, cu procese privind drepturile de autor din partea unor autori care fac acuzații similare de piraterie. Mai mulți autori care au optat să nu participe la înțelegerea colectivă au, de asemenea, procese individuale în curs împotriva Anthropic.