DeepSeek-R1, kiinalaisen DeepSeek-laboratorion lippulaivatason päättelymalli, hallusinoi 14,3 % Vectaran HHEM 2.1 -vertailun mukaan. Tämä on lähes nelinkertainen määrä verrattuna ei-päättelymalli DeepSeek-V3:een, jonka tulos oli 3,9 %.
Tämä ero herättää vaikeita kysymyksiä kryptosektorilla. Nopeasti kasvava ryhmä AI-agenttien tokeneita käyttää nyt päättelyyn perustuvia LLM-malleja itsenäiseen kaupankäyntiin, signaaleihin ja ketjussa tapahtuvaan toimeenpanoon.
Vectaran data osoittaa, että R1 “yliavustaa” virheellisillä faktoilla
Vectara ajoi molemmat DeepSeek-mallit HHEM 2.1:n läpi, joka on Vectaran oma hallusinaatiotestausjärjestelmä. Tiimi tarkisti tulokset myös Googlen FACTS-menetelmällä. R1 tuotti enemmän vääriä tai perusteettomia väitteitä kuin V3 kaikissa testimuodoissa.
Syynä ei ollut vain päättelysyvyyden kasvu. Vectaran analyytikot havaitsivat, että R1:lla on taipumus “yliavustaa”. Malli lisää tietoa, jota ei ole lähdetekstissä.
Lisätty yksityiskohta voi olla faktuaalisesti oikein, mutta lasketaan silti hallusinaatioksi. Tällainen käytös ujuttaa keksittyä kontekstia muuten oikeisiin vastauksiin.
Vectara toi tämän havainnon esille suoraan julkisessa X-viestissään.
“DeepSeek-R1 näyttää 14,3 %:n hallusinaatioprosentin, lähes 4x enemmän kuin DeepSeek-V3,” Vectara totesi viestissään.
Kuvio ei ole vain DeepSeekin ongelma. Alan seuraajat huomioivat samanlaisen kompromissin myös muiden laboratorioiden päättelyyn koulutetuissa malleissa. Vahvistusoppiminen, joka kehittää ajatusketjua, palkitsee samalla rohkeampaa ja itsevarmempaa sisällöntuotantoa.
Miksi krypto-AI-tokenit joutuvat tämän kompromissin eteen
Kryptomarkkinoilla on nyt satoja AI-agenttien tokeneita, kuten Virtuals Protocol (VIRTUAL), ai16z (AI16Z) ja aixbt (AIXBT).
Kategoria on kasvanut noin 39,4 % viimeisen 30 päivän aikana. Virtuals on yksin ylittänyt 576 miljoonan dollarin markkina-arvon.
Useimmat näistä agenteista käyttävät suurta kielimallia työkalujen kanssa. Näiden työkalujen avulla agentti voi julkaista sosiaalisessa mediassa, ohjata kauppoja, luoda tokeneita tai tuottaa markkinakommentteja.
Jos taustalla oleva malli keksii hinnan, kumppanuuden tai sopimuksen osoitteen, seuraukset voivat siirtyä suoraan lohkoketjuun.
Yksi BeInCrypton AIXBT-agentin analyysi osoitti, että agentti oli mainostanut 416 tokeneita 19 % keskimääräisellä tuotolla. Sama toimintalogiikka altistaa kuitenkin seuraajat huonoille suosituksille mallin epäonnistuessa.
Riskit kasvavat automaation myötä. Vain lukemista suorittavat agentit, jotka tiivistävät tunnelmaa, eroavat niistä agenteista, joilla on pääsy kassatiedostoihin.
Päättelymallit houkuttelevat erityisesti agentteja, jotka suunnittelevat monivaiheisia toimia. Juuri näissä käyttötarkoituksissa Vectaran 14,3 %:n lukema on merkittävin.
Yksi keksitty fakta ajatusketjun alussa voi siirtyä kaikkiin seuraaviin toimiin.
LeCunin mukaan ongelma on arkkitehtuurissa
Yann LeCun, Metan päätekoälytutkija, on pitkään väittänyt, että autoregressiiviset LLM:t eivät voi täysin välttää hallusinaatioita. Hänen mukaansa arkkitehtuuri ei perustu todelliseen maailmaan.
Vahvistusoppiminen ajatusketjussa voi peittää ongelman rajatuilla alueilla, kuten matematiikassa ja koodauksessa. Perimmäinen syy säilyy silti.
Toiset alan laboratoriot ovat eri mieltä. He korostavat etenkin edistystä benchmark-hallusinaatioprosenteissa esimerkiksi haun laajennuksen, jälkikoulutuksen ja vahvistusmallien avulla. Kehittäjien kokemukset kuitenkin usein vastaavat tilastodataa.
AI-tutkija xlr8harder kuvaa X:ssä R1-mallin debuggausta ja kiteyttää arjen kokemuksen.
“Deepseek R1 ymmärtää ajatuskulkujaan kiinnostavan hajautuneesti. … joten se turvautuu harhauttamaan minua hallusinaatioilla”, hän totesi.
Kryptoagenttien kehittäjille käytännön kysymys liittyy riskien hallintaan, ei arkkitehtuuriin. Suunnitelmat, jotka ohjaavat jokaisen mallin väitteen tarkistuksen kautta, voivat menestyä paremmin.
Sama koskee agenteja, jotka käyttävät pienempiä ja varovaisempia malleja taloudellisissa toimissa.
Tulevat ranking-tilastot ja R1:n seuraajat näyttävät, kaventuuko päättely- ja tarkkuuskompromissi.
Tällä hetkellä 14,3 % ja 3,9 % välinen ero on operatiivinen yksityiskohta, jota kannattaa seurata. Se voi erottaa oikeita tuotteita julkaisevat AI-agenttien tokenit niistä, jotka tarjoavat vain lupauksia.









