Sintetiniais duomenimis maitinami dirbtinio intelekto modeliai vis dažniau pradeda generuoti iškraipytą turinį ir visišką chaosą. Naujausi tyrimai rodo, kad nekontroliuojamas mašininio mokymosi ratas gali iš esmės sugriauti sistemų patikimumą, jei nebus rasta būdų, kaip šį procesą suvaldyti.

Užburtas sintetinių duomenų ratas

Sąvoka „modelio kolapsas“ (angl. model collapse) pirmą kartą buvo suformuluota 2024 metais. Šis terminas apibūdina scenarijų, kai dirbtinio intelekto modelis, nuolat mokomas naudojant paties dirbtinio intelekto sukurtus duomenis, ilgainiui nustoja teikti tikslius rezultatus. Vietoj naudingos informacijos sistema pradeda generuoti netikslią, beprasmę informaciją arba tiesiog visišką chaosą. Taip nutinka dėl prastos mokymo duomenų kokybės, kai klaidos ir iškraipymai su kiekviena karta tik stiprėja.

Problema darosi vis gilesnė. Kai internete sparčiai daugėja generatyvinio turinio, naujosios sistemos neišvengiamai įtraukia šį turinį į savo mokymosi procesus.

Londono mokslininkų siūlomas kelias

Viltis išspręsti šią problemą atsirado neseniai. Londono karališkojo koledžo (King's College London) tyrėjai 2026 m. gegužės 14 d. pristatė naują mokslinį darbą, kuriame paaiškinami vidiniai dirbtinio intelekto veikimo principai. Šis tyrimas gali padėti rasti būdą, kaip apeiti modelio kolapso grėsmę. Mokslininkų teigimu, geresnis vidinių procesų supratimas ateityje leistų išvengti vis dažniau pasitaikančių dirbtinio intelekto haliucinacijų.

Metodas svarbus. Suprasdami, kaip tiksliai informacija keliauja per neuroninius tinklus, inžinieriai gali sukurti filtrus, neleidžiančius sistemai mokytis iš savo pačios klaidų.

Tikslumo paieškos be išankstinių modelių

Siekis išvalyti duomenis nuo triukšmo reikalauja naujų matematinių sprendimų. Mokslinėje analizėje, nagrinėjančioje baigtinių duomenų rekonstravimą naudojant Padé sekas, siūlomas metodas, kuriam nereikia jokio išankstinio modelio neatitikimų kilmei paaiškinti. Šis algoritmas sugeba atskirti tikrąsias analitines savybes nuo klaidingų struktūrų, kurias sukelia ribotos informacijos efektai.

Kai mokymo duomenyse dominuoja sintetiniai vaizdai ar tekstai, o tikrinimas vyksta uždarose laboratorijose, tikrasis sistemų stabilumas išlieka sunkiai prognozuojamas. „Databricks“ technologijų vadovas Europai, Artimiesiems Rytams ir Afrikai (EMEA) Daelis Williamsonas pastebi, kad sintetiniai duomenys neturėtų visiškai pakeisti tikrųjų duomenų. Jo teigimu, jie turėtų būti naudojami tik tikriems duomenims papildyti ir išplėsti, siekiant sukurti kokybiškus dirbtinio intelekto modelius bei agentus.

Standartizacija ir saugumo modeliai

Siekis suvaldyti duomenų srautus vyksta ir valstybiniu lygmeniu. JAV Kibernetinio saugumo ir infrastruktūros saugumo agentūra (CISA) išleido naujausią viešą Nuolatinės diagnostikos ir švelninimo (CDM – Continuous Diagnostic & Mitigation) duomenų modelio dokumento versiją. Tokie standartai padeda užtikrinti, kad sistemose naudojami duomenys išlaikytų struktūrinį vientisumą ir būtų apsaugoti nuo išorinių manipuliacijų.

Ateityje atliekami praktiniai bandymai parodys, ar teoriniai modelio kolapso sprendimai veiksmingai prigys komercinėse sistemose. Tikėtina, kad per artimiausius metus griežtesnė sintetinių duomenų atranka taps standartine procedūra visiems didžiųjų kalbos modelių kūrėjams.

Šaltiniai

  1. [1] [arXiv | 2026-08-13] Long-window 4DVar for reanalysis using a differentiable weather model
  2. [2] [arXiv | 2026-08-13] Analytically Consistent Reconstruction of Finite Data Using Pad\'e Sequences
  3. [3] [arXiv | 2026-08-13] DLESyM-Ocean: A Deep Learning Probabilistic Global Model for Simulating Present-Day Upper Ocean and Sea Ice
  4. [4] [X.com] Growing our understanding of plants!
  5. [5] [X.com] RT @ErikVoorhees: There is still a widespread misunderstanding that using a Chinese model = your data goes to China
  6. [6] [X.com] RT @CISAgov: 📢We released the latest public version of the Continuous Diagnostic & Mitigation (CDM) Data Model Docum
  7. [7] [X.com] 📢We released the latest public version of the Continuous Diagnostic & Mitigation (CDM) Data Model Document. This doc