Conform HotNews: Piața de AI, acuzată de distrugerea cărților pentru antrenarea modelelor lingvistice
Companii de inteligență artificială, precum ANTHROPIC, ar cheltui milioane de dolari pe achiziționarea de cărți fizice, pe care ulterior le distrug prin tăierea cotorului, pentru a putea scana rapid paginile necesare antrenării modelelor lingvistice de mari dimensiuni. Această practică, numită „scanare distructivă”, a stârnit îngrijorări în rândul anticariilor și a ridicat semne de întrebare legate de drepturile de autor și protecția proprietății intelectuale.
O interpretare bizară a legislației americane
Un tribunal din Statele Unite a stabilit că procesul de scanare a cărților pentru antrenarea inteligenței artificiale intră sub incidența doctrinei „fair use”, adică utilizare rezonabilă. Totuși, pentru a evita încălcarea legislației privind drepturile de autor, companiile implicate sunt obligate să distrugă exemplarele fizice după scanare. Astfel, interpretarea legală susține că, de vreme ce există un singur exemplar fizic înainte de scanare și un singur exemplar digital după, nu se poate vorbi de piraterie.
Investigații jurnalistice au dezvăluit că astfel de comenzi masive de cărți ajung la unități Amazon din LAS VEGAS, unde se desfășoară procesul de „scanare distructivă”. Deși AMAZON nu este un jucător major direct în dezvoltarea AI, compania își manifestă interesul pentru această tehnologie, vizând sporirea vânzărilor prin comerțul electronic și optimizarea afacerilor sale de cloud computing.
Librarii canadieni, alertați de comenzi suspecte
Anticarii din CANADA au început să primească solicitări neobișnuite pentru volume mari de cărți, care nu aveau o explicație aparentă. PETER SELLERS, proprietarul librăriei SELLERS & NEWEL din TORONTO, a declarat că, în ultimul timp, a primit telefoane „foarte suspecte” pentru comenzi de cărți aleatorii, spre deosebire de cererile anterioare de la designeri de interior sau platouri de filmare, care aveau criterii specifice. Acesta a primit un mesaj pe LINKEDIN de la o companie pretinsă a fi specializată în ingineria datelor, care căuta să achiziționeze volume mari de cărți second-hand.
SELLERS a refuzat solicitarea, considerând-o suspectă, și a realizat mai târziu, după ce a citit despre scandalul scanării cărților pentru AI, că motivele din spatele acestor comenzi erau altele. El a subliniat că personalul său este acum atent la astfel de solicitări și că răspunsul este „nu”, cu excepția cazurilor în care cumpărătorul are o legitimitate dovedită.
Un boom neașteptat pe piața anticariatelor
Alți vânzători de cărți au confirmat primirea unor solicitări similare în ultimele luni, inclusiv pentru cărți educaționale mai puțin căutate. Mulți consideră că este greu să refuze astfel de comenzi, într-o industrie care traversează dificultăți economice. Numele companiilor care fac aceste solicitări par să se schimbe frecvent, iar nimeni nu a recunoscut public că furnizează cărți pentru companii de AI.
Compania ZOOM BOOKS, cu sediul în BRITANIEI COLUMBIA, a fost menționată pe forumuri online ca efectuând un număr mare de comenzi de volume mari, de proveniență neclară. Vânzători de cărți din mai multe țări, inclusiv Spania, Germania, AUSTRALIA, NOUA ZEELANDĂ și Marea Britanie, și-au exprimat suspiciunea că aceste comenzi sunt destinate scanării pentru AI, deși nu există dovezi concrete.
PATRICK HEMPELMANN, proprietarul librăriei BMV BOOKS din TORONTO, a declarat că ZOOM a început să cumpere sute de cărți de la el în urmă cu aproximativ șase luni. Comenzile vizau în special cărți tehnice specializate, medicale vechi sau manuale de nivel postuniversitar, fără o logică aparentă. HEMPELMANN, la rândul său, a considerat situația „pur și simplu tristă”, subliniind că „cărțile nu ar trebui distruse”.
Nevoia de conținut original, stimul pentru companiile de AI
ZOOM BOOKS a precizat într-un email că nu vinde către ANTHROPIC, însă nu a confirmat sau infirmat relații comerciale cu alte companii de AI. Cărțile fizice, în special cele publicate înainte de apariția ChatGPT în 2022, sunt considerate valoroase pentru companiile de AI. Experții se tem că modelele lingvistice se pot degrada dacă sunt antrenate exclusiv pe propriile rezultate.
Astfel, companiile de inteligență artificială au nevoie de texte scrise de oameni pentru a antrena viitoarele modele lingvistice. Problemele legate de „halucinațiile” generate de primele versiuni ale instrumentelor AI, adică informații inventate, fac ca nevoia de conținut original și verificat să fie crucială, pentru a evita ca output-ul lor să devină profund viciat.
Sursa: HotNews



