Aiheeseen liittyväTulevaisuuden teknologian ja tekoälyn neuvosto

Grok 4.5 top Agent Test, tukee Muskin Opus-Class-väitettä

  • Grok 4.5 nousi riippumattoman agentti-tunnusluvun kärkeen, tukien Muskin kustannusväitteitä.
  • Malli sai 51,4 % AutomationBench-AA:ssa, ja hinta oli johtajista halvin.
  • Kuitenkin, malli kirjasi myös 0,63 sääntörikkomusta tehtävää kohden, enemmän kuin kilpailijat.

Elon Musk kutsui Grok 4.5:ttä Opus-luokan malliksi, joka toimii nopeammin ja on edullisempi. Riippumaton, agenttipohjainen tunnusluku tukee nyt tätä väitettä.

Artificial Analysisin AutomationBench-AA:ssa Grok 4.5 sijoittui ensimmäiseksi 51,4 %:n tuloksella. Yhden tehtävän hinta oli 0,34 dollaria. Se päihitti sekä Claude Fable 5:n (48,6 %) että Claude Opus 4,8:n (48,5 %).

AutomationBench-AA:n pistemäärät AI-malleille.
AutomationBench-AA:n pistemäärät AI-malleille. Lähde: Artificial Analysis

Riippumaton tarkistus Elon Muskin väitteelle

SpaceXAI toi Grok 4.5:n julkisesti saataville tällä viikolla, ja se on rakennettu 1,5 biljoonan parametrin V9-pohjalle. Muskin esitys perustui varhaisiin sisäisiin arvioihin.

AutomationBench-AA muuttaa tilanteen. Artificial Analysis suorittaa tämän tunnusluvun itsenäisesti ja pitää tehtäväkokonaisuuden salassa vääristymien estämiseksi.

Testi sisältää 657 tehtävää 40 simuloidussa sovelluksessa, kuten Gmail, Slack, Salesforce ja HubSpot. Pisteytys perustuu siihen, kuinka monta tavoitetta agentti suorittaa rikkoen mahdollisimman vähän sääntöjä.

Seuraa meitä X:ssä pysyäksesi ajan tasalla tuoreimmista uutisista

Grok 4.5: Edullisempi, nopeampi ja useimmiten sääntöjen mukainen

Grok 4.5:n 0,34 dollaria per tehtävä jäi selvästi Fable 5:n 1,35 dollarin ja Opus 4,8:n 1,46 dollarin alapuolelle. Gemini 3,5 Flash pääsi lähimmäksi hintaan 0,49 dollaria.

Malli käytti noin 8 000 output-tokenia tehtävää kohti, mikä on noin neljäsosa Opus 4,8:n määrästä. Tämä tehokkuus selittää suurimman osan hintaerosta ja vastaa Muskin lanseerauspuhetta.

”Mallin kokonais-tokenkulutus, 0,44M per tehtävä, on yksi pienimmistä tulostaululla. Alhainen kustannus johtuu tästä tehokkuudesta sekä alhaisista tokenhinnoista,” Artificial Analysis kertoi.

Grok 4.5 saavutti lisäksi 79,9 % tavoitteista ja läpäisi täysin 21,9 % tehtävistä. Rahoitus-sektorissa, joka oli haastavin, Grok 4.5 johti 71 %:lla, kun Fable 5:n tulos oli 64 % ja Opus 4,8:n 62 %.

Malli rikkoi kuitenkin sääntöjä enemmän kuin tärkeimmät kilpailijansa. Se kirjasi 0,63 sääntörikettä tehtävää kohden, kun Opus 4,8:n vastaava luku oli 0,55 ja Gemini 3,5 Flashin 0,46.

Tämä ero on merkittävä yrityksille, jotka käyttävät agentteja suoraan rahoitusjärjestelmissä, sillä yksikin rikkomus voi aiheuttaa todellisia kustannuksia.

Tilaa YouTube-kanavamme saadaksesi asiantuntijanäkemyksiä alan johtajilta ja toimittajilta

Vastuuvapauslauseke

BeInCrypto on sitoutunut puolueettomaan ja läpinäkyvään raportointiin. Tämän uutisartikkelin tarkoituksena on tarjota täsmällistä ja ajantasaista tietoa. Lukijoita kehotetaan kuitenkin tarkistamaan tiedot itsenäisesti ja kääntymään ammattilaisen puoleen ennen kuin he tekevät päätöksiä tämän sisällön perusteella. Huomaathan, että olemme päivittäneet käyttöehtomme, tietosuojakäytäntömme ja vastuuvapauslausekkeemme.