Aiheeseen liittyväTulevaisuuden teknologian ja tekoälyn neuvosto

Anthropicin uusi Sonnet-malli lähestyy Opus-suorituskykyä mutta käyttää enemmän tokeneita

  • Anthropic julkaisi Claude Sonnet 5.5:n, jonka väitetään toimivan yli 30 prosenttia nopeammin kuin Sonnet 5.
  • Artificial Analysis sijoittaa sen toiseksi Intelligence Index -indeksissään, vain Opus 5,5:n jälkeen.
  • Suurimmalla teholla Sonnet 5.5 käytti noin 60 % enemmän lähtötokeneita kuin Opus 5.5.

Anthropic julkaisi Claude Sonnet 5,5:n 28. syyskuuta samaan listahintaan kuin Sonnet 5. Yrityksen mukaan malli toimii yli 30 % nopeammin ja maksaa tehtävää kohti jopa 30 % vähemmän.

Riippumaton vertailuyritys päätyi kuitenkin eri johtopäätökseen kustannuksista, kun se testasi mallia äärirajoille asti.

Seuraa meitä X:ssä ja saat viimeisimmät uutiset heti tuoreeltaan

Anthropicin toinen 5,5-malli julkaistiin vain päiviä Opus-mallin jälkeen

Sonnet 5,5 on toinen malli Claude 5.5 -perheessä. Anthropic lanseerasi Opus 5.5:n 22. syyskuuta. Samana päivänä OpenAI julkaisi myös GPT-6 Solin ja Lunan.

Uusi malli säilyttää Sonnet 5:n hinnoittelun: 2 dollaria per miljoona syötetokeneita ja 10 dollaria per miljoona ulostulotokeneita. Anthropic ilmoitti 70,6 % tuloksesta Terminal-Bench 4.0 -agenttiohjelmointitestissä. Sonnet 5 sai 10,3 %, kun taas Opus 5.5 ylsi 66,4 %:iin.

”Opus 5.5 on suunniteltu monimutkaisia tehtäviä varten, joissa vaaditaan tarkkaa harkintaa. Sonnet 5.5 taas on paras rajattujen arjen tehtävien, bugikorjausten sekä viimeisteltyjen dokumenttien, diojen ja taulukoiden luomiseen,” tiimi totesi.

Anthropic kertoi, ettei Sonnet 5,5 laajenna mallin osaamisen rajoja. Tämän vuoksi arviointikeskustelu keskittyi riskeihin, kuten käyttäjien harhaanjohtamiseen ja mallin käyttämiseen väärin vaativissa tilanteissa.

Sonnet 5,5 sisältää myös kyber-turvallisuuteen liittyviä suojauksia ja anti-distillaatioluokittelijoita. Ne estävät yritykset paljastaa mallin päättelyä kilpailijoiden koulutusmalleihin. Claude Haiku 5,5 julkaistaan lähiviikkoina.

Samaan aikaan OpenAI hylkäsi tulevan GPT-6.1 Astra -mallin turvallisuussyistä. CNBC vahvisti maanantaina, että malli ei yltänyt yrityksen laatuvaatimuksiin.

Artificial Analysis paljasti maksimi-suorituksella korkeamman token-määrän

Artificial Analysis, joka arvosti Grok 4.7:n neljänneksi, antoi Sonnet 5,5:lle 56 pistettä Intelligence Index -mittarilla. Tämä sijoittaa mallin toiseksi, vain kaksi pistettä Opus 5.5:n taakse maksimi-teholla.

Yhtiö kirjasi Sonnet 5,5:lle 64 % Terminal-Bench 4.0:ssa, kun taas Opus 5.5 ja GPT-6 Astra saavuttivat 60 %. Tietotyötesteissä, kuten GDPval-AA:ssa, Sonnet 5,5 oli suunnilleen opuksensa veroinen.

Yhtiön mukaan Sonnet 5,5 käytti selvästi enemmän tokeneita kyseisten tulosten saavuttamiseen.

“Maksimi-suorituksella, kun se lähestyy Opus 5.5:n tasoa, Claude Sonnet 5,5 käytti noin 193 000 ulostulotokenia per Intelligence Index -tehtävä,” julkaisussa kerrotaan.

Tuo määrä on noin 60 % enemmän kuin mitä Opus 5.5 ja Sonnet 5 käyttävät maksimi-teholla. Lisäksi määrä on noin seitsemän kertaa enemmän kuin GPT-6 Astra käyttää maksimisuorituksella.

Antrhopicin mainitsemat varhaiskäyttäjät raportoivat kuitenkin päinvastaisen kehityksen Sonnet 5:een verrattuna, tosin erilaisissa työkuormissa. Balyasny Asset Management huomasi selvästi pienemmän token-kulutuksen rahoitustehtävissään.

“Yksityisessä 2 441 rahoitustehtävän kokonaisuudessamme, joka kattaa Q&A:n, tietojen poiminnan, analyysit ja ennusteet, Claude Sonnet 5,5 sai paremmat pisteet kuin Sonnet 5 ja käytti noin 121 000 tokenia per vastaus. Sonnet 5 taas käytti 497 000 tokenia,” Joe Poirier, Senior AI Engineer, Balyasny Asset Management, totesi.

Artificial Analysis testasi ennakkoversiota, jossa oli rakenteisen ulostulon bugi, jonka Anthropic on sittemmin korjannut. Yhtiö aikoo tehdä vertailut uudelleen lähiaikoina.

Tilaa YouTube-kanavamme ja seuraa, kun johtajat ja toimittajat jakavat asiantuntijanäkemyksiä

Vastuuvapauslauseke

BeInCrypto on sitoutunut puolueettomaan ja läpinäkyvään raportointiin. Tämän uutisartikkelin tarkoituksena on tarjota täsmällistä ja ajantasaista tietoa. Lukijoita kehotetaan kuitenkin tarkistamaan tiedot itsenäisesti ja kääntymään ammattilaisen puoleen ennen kuin he tekevät päätöksiä tämän sisällön perusteella. Huomaathan, että olemme päivittäneet käyttöehtomme, tietosuojakäytäntömme ja vastuuvapauslausekkeemme.