ICIA, partener într-un proiect european de referință în domeniul LLM
Institutul de Cercetări pentru Inteligență Artificială „Mihai Drăgănescu” (ICIA, www.racai.ro), institut al Academiei Române fondat în 1994, derulează în prezent proiecte internaționale legate de modele mari de limbă, cât și de identificare de știri false („fake news”) generate cu AI. Începând cu anul 2025 ICIA este implicat în proiectul european LLMs4EU (Large Language Models for the European Union - Modele mari de limbă pentru Uniunea Europeană). Proiectul, aflat sub coordonarea ALT-EDIC (Alliance for Language Technologies) reunește peste 60 de parteneri din 20 de țări.
Proiectul LLMs4EU își propune să păstreze diversitatea lingvistică și culturală europeană în era digitală prin cooperarea dintre actorii economici și cei academici, având în vedere că unele limbi europene sunt în pericol de a fi lăsate deoparte în dezvoltarea inteligenței artificiale generative din cauza lipsei de resurse necesare pentru antrenarea modelelor lingvistice. Proiectul intenționează să reunească unii dintre cei mai importanți actori europeni din domeniul inteligenței artificiale generative pentru a se asigura că firmele europene, în special IMM-urile, au acces la instrumentele și resursele necesare pentru a deveni competitive în ceea ce privește tehnologiile lingvistice și, în special, modelele de limbaj de mari dimensiuni (LLM).
Proiectul se concentrează pe cinci domenii de aplicare: energie, telecomunicații, turism, servicii publice și știință. Scopul este de a pune la dispoziție modelele LLM și toate instrumentele necesare pentru exploatarea acestora în toate limbile UE într-un mod deschis, valorificând programele și competențele europene. Instrumentele care vor fi accesibile companiilor europene vor acoperi toate etapele, de la antrenarea LLM-urilor până la asigurarea conformității acestora cu legislația europeană (AI Act, GDPR etc.).Proiectul va dezvolta modele de bază și derivate pentru diferite limbi europene. Totodată vor fi investigate diferite cazuri de utilizare relevante pentru a demonstra capacitatea actorilor europeni de a colabora în vederea creării de instrumente adaptate pentru diferite sectoare economice, iar acoperirea tuturor limbilor UE va fi asigurată prin crearea și achiziționarea seturilor de date necesare în cadrul proiectului.
Implicarea ICIA în LLMs4EU vine ca urmare a unui lung șir de proiecte de succes în domeniul prelucrării limbajului natural. În cele ce urmează amintim doar câteva din cele mai recente inițiative. Corpusul Reprezentativ al Limbii Române Contemporane (CoRoLa), desfășurat ca program prioritar al Academiei Române, implicând ICIA și Institutul de Informatică Teoretică din Iași (IIT), reprezintă cea mai importantă resursă de limbă română contemporană disponibilă pentru cercetări lingvistice și în domeniul inteligenței artificiale. Corpusul conține texte diverse, datând din 1989 și până astăzi, scopul creării acestuia fiind să ofere o imagine obiectivă a limbii române actuale scrise și vorbite. Spre deosebire de alte resurse obținute prin colectarea automată de pe Internet, a căror calitate nu este clară, corpusul CoRoLa include doar texte de o calitate superioară, preprocesate, fără probleme legate de drepturi de autor. Corpusul este în continuă dezvoltare pe măsură ce sunt semnate noi acorduri cu furnizorii de texte.
Proiectele MARCELL și CURLICAT au vizat crearea unor resurse (cu același nume) utilizabile pentru sisteme de traducere automată integrate în infrastructura europeană Connecting Europe Facilitfy (CEF) Automatic Translation (AT). Resursele sunt oferite în mod deschis pentru cercetare. Proiectul MARCELL (Multilingual Resources for CEF.AT in the legal domain) a condus la crearea celei mai mari resurse de limbă română din domeniul legislativ, integrată într-un corpus comparabil cu alte 6 limbi europene. A fost utilizată o abordare similară celei din CoRoLa, vizând crearea unei resurse de o calitate superioară, preprocesată, adaptată nevoilor de dezvoltare a sistemelor cu inteligență artificială. Proiectul CURLICAT (Curated Multilingual Language Resources for CEF AT) a venit în continuarea activităților anterioare, conducând la crearea unei noi resurse vizând domenii relevante pentru Infrastructurile de Servicii Digitale Europene (DSI).
Pe lângă construirea de resurse de text, audio și imagine relevante pentru cercetarea în AI românesc, ICIA a dezvoltat și sisteme de AI, incluzând componente inovative, reutilizate apoi în diferite proiecte pentru a facilita analiza automată a resurselor. Multe din aceste instrumente au fost integrate în platforma RELATE (https://relate.racai.ro). Platforma este deschisă cercetătorilor interesați de acces la resurse moderne pentru analiză multimodală (combinând text, imagine și voce) pentru limba română. Facilitățile oferite de platformă vor fi utilizate în proiectul LLMs4EU pentru preprocesarea și asigurarea calității datelor ce vor fi utilizate apoi în cadrul proiectului. Totodată, platforma continuă să fie extinsă cu rezultatele diferitelor proiecte de cercetare aflate în desfășurare.
Tags: Cercetare, ICIA, AI, Large Language Models, Proiect LLMs4EU
Parerea ta conteaza: 





























UVT, catalizator al mișcării academice timișorene, își urmează calea spre cunoașterea aprofundată și trecerea către tehnologiile viitorului și ale noilor generațiiUniversitatea de Vest din Timișoara este astăzi cea mai dinamică instituție de învățământ superior din România, o universitate care se...









Se pregătește noul program cadru al UE pentru cercetare și inovare: noi ce facem?