Hiina avatud kaaludega mudelid on hankeanalüüsis järele jõudnud
20. august 2026

Hiina avatud kaaludega mudelid on hankeanalüüsis järele jõudnud

Mais võrdlesime nelja mudelit sünteetilise hanke peal ja avatud kaaludega osaleja — Zhipu GLM-5.2 — jäi usaldusväärsuses viimaseks: see lõpetas ühe käivituse kuuest, ülejäänud katkesid vigase JSON-i tõttu. Kolm kuud hiljem käivitasime sama analüüsi kaks korda päris pakkumuse peal — korra Claude'iga, korra GLM-5.3-ga — ja mõlemad käivitused jõudsid sama soovituseni, nimetasid samad kolm probleemi ja kulude vahe oli 17%. Hinnakirjad erinevad 3,6 korda.

Mõlemad pooled sellest on olulised. Avatud kaaludega mudel on nüüd tõesti konkurentsivõimeline ja raha, mida sellele üleminekuga säästate, on palju vähem, kui tema hinnakiri lubab.

3 / 3
kõige raskemat probleemi, mille mõlemad käivitused leidsid üksteisest sõltumatult
3,6×
hinnakirja vahe sisendtokenite puhul — millest sai 17% vahe tegelikult makstus
1,7×
rohkem tokeneid kulutas odavam mudel sama töö tegemiseks

Mida me võrdlesime

Dokumendikomplekt oli käimasolev telekommunikatsioonihange — keskmise suurusega tarkvaraplatvorm, 94 kontrollitavat nõuet, neist 40 kohustuslikud — päris pakkuja esitatud pakkumuse vastu. Oleme mõlemad pooled anonümiseerinud, sest hange on veel avatud. Erinevalt meie mai võrdlusest ei olnud siin vastusevõtit, seega ei saanud kumbagi käivitust hinnata ette valmistatud puuduste nimekirja vastu. Kaht väga erinevat mootorit saab võrrelda selle järgi, kas nad samu dokumente lugedes jõuavad sama kutselise hinnanguni.

Piirasime selle võrdluse kahe etapiga, kus otsus tegelikult kujuneb: peamine arutlusagent, mis loeb hankedokumente ja pakkumust ning kirjutab leiud, ja kontrollietapp, mis iga leiu algdokumentide vastu üle kontrollib, enne kui see kasutajani jõuab. Claude'i käivitus kasutas arutlemiseks Opus 4.8 ja kontrolliks Sonnet 4.6; GLM-i käivitus kasutas mõlemaks GLM-5.3, milleni jõudsime OpenRouteri kaudu.

Hinnakiri ütleb ühte

Miljoni tokeni kohta ei ole see tasavägine võistlus:

Avaldatud hinnakirja hind miljoni väljundtokeni kohta
Anthropicu otsehinnad; GLM-5.3 OpenRouteri kaudu.
Claude Opus 4.8 $25,00
Claude Sonnet 4.6 $15,00
GLM-5.3 $4,40

Opus 4.8 kulu on $5 sisendi ja $25 väljundi eest; Sonnet 4.6 on $3 ja $15; GLM-5.3 on $1,40 ja $4,40. Väljundtokenite puhul on see 5,7-kordne vahe Opuse ja 3,4-kordne Sonneti suhtes.

Arve ütleb teist

Mõlema etapi peale kokku läks Claude'i käivitus maksma $6,64 ja GLM-i käivitus $5,52 — sääst 17%, mitte 72%.

Tegelik teenusepakkuja kulu: peaagent ja kontroll
Ühe pakkumuse üks analüüs ühe hanke vastu. Vähem on parem.
Claude (Opus + Sonnet) $6,64
GLM-5.3 $5,52

Vahe kahaneb, sest GLM-5.3 vajas selleks tunduvalt rohkem tokeneid. Claude arvestas 5,49 miljonit tokenit 147 mudelipäringu jooksul; GLM 9,42 miljonit 223 päringu jooksul. Tokeni kohta oli GLM 2,1 korda odavam, kuid kasutas neid 1,7 korda rohkem, ja need kaks mõju tasakaalustavad üksteist peaaegu täielikult.

Selle taga on kaks asja. GLM-5.3 arutleb märksa rohkem: 295 000 mõtlemistokenit Claude'i 17 000 vastu, see on seitseteist korda rohkem, ja suurem osa sellest on kontrollietapis. Ja tema päringute vahemälu käitus teisiti — Claude luges vahemällu pandud eesliidet uuesti kümnendiku sisendihinna eest ja maksis selle kirjutamise eest lisatasu, samal ajal kui GLM-i käivituses registreeriti 7,8 miljonit vahemälulugemist ja mitte ühtki vahemälukirjutust. Vahemälu majandus ei ole muljetavaldav, kuid see liigutab arvet rohkem kui pealkirjahind.

Odav tokeni kohta ei ole sama mis odav töö kohta

See on teine kord, kui me seda mõõdame. Mais oli Gemini 3.1 Prol neljast mudelist madalaim tokenihind ja ühtlasi kõige kallim tegelikult käivitada, sest see luges dokumente iga nõude juures uuesti. Tokeniisu kaalub üles tokenihinna.

Otsused langesid kokku

Mõlemad käivitused andsid sama soovituse — esitada koos parandustega — ja mõlemad tuvastasid üksteisest sõltumatult pakkumuse samad kolm kõige tõsisemat probleemi: puuduliku hinnatabeli, mis jättis ühe muutuva kulu hankes nõutud kindlast summast välja; tunnistuse, mille olemasolu pakkuja kinnitas, kuid mida ta ei lisanud; ja suure osa kohustuslikest nõuetest, mille kohta pakkuja ise möönis, et need ei ole esitamistähtajaks valmis. Claude koostas 12 leidu, GLM 11.

Esimeses neist ei olnud kaks mudelit ühel meelel raskusastme, mitte sisu osas: Claude nimetas hinnaprobleemi kriitiliseks, GLM oluliseks. Mõlemad selgitasid seda ühtemoodi ja mõlemad viitasid hankedokumendi punktile, millega see vastuollu läheb.

Kus nad lahku läksid

Claude oli põhjalikum. See tõi välja kaks nõrka kohta, mida GLM üldse ei maininud — nõrgad teenustaseme kohustused, mis algavad alles pärast esimest tarne-verstaposti, ja tarnetähtajad, mis olid vaikimisi seotud sellega, et tellija vastab viie tööpäeva jooksul. Kumbki neist pakkumust põhja ei laseks; mõlemad on asjad, mida pakkumuse juht sooviks teada. Claude käsitles kvalifitseerimisläve riski ka kontrollitud olulise leiuna, kus GLM kandis selle kontrollimata vähemolulisena.

GLM oli täpsem. Kus Claude kirjutas, et umbes 17 ligikaudu 48 nõudest ei ole kättesaadavad, luges GLM kohustusliku alamhulga täpselt kokku: 27 nelikümnest, neist 12 osaliselt ja 15 veel ehitamata, ja pani protsendi kokkuvõttesse. See tsiteeris täpseid lepingusummasid ja esitamistähtaega. Dokumendi jaoks, mida hankespetsialist peab kaitsma, on selline täpsus midagi väärt.

GLM läks ka ikka korra rikki. Ühe nõude juures väljastas see 98-kilobaidise lõpetamata stringi ja see kontroll ebaõnnestus täielikult. See on sama tõrketüüp, mis tappis mais viis kuuest GLM-5.2 käivitusest — kuid surmavast sai üks vahele jäänud punkt 94-st. Usaldusväärsuse probleem on kahanenud kareda servani.

Kolm kuud tagasi ei suutnud avatud kaaludega mudel tööd lõpetada. Nüüd vaidleb see tipptasemel mudeliga raskusastme üle ja võidab arvutamises.

See osa, mille kohta kõik tegelikult küsivad

Keegi Euroopa riigihangetes ei taha kuulda, et tema hankedokumendid saadeti Hiina API-le. Mure on põhjendatud ja sellel on mudeli kvaliteediga vähe pistmist. See on selle kohta, kuhu dokumendid jõuavad ja kelle õiguslikud nõudmised ulatuvad ettevõtteni, kes neid hoiab. Tellijale, kes käsitleb ärialaselt tundlikke pakkumusi, lõpetab see vastuväide vestluse.

Avatud kaalud muudavad selle vastuväite kuju, sest mudel lõpetab teenuseks olemise ja muutub failiks. Kaalud, mida saab alla laadida, töötavad teie kontrollitaval riistvaral või Euroopa teenusepakkuja juures, keda olete juba kontrollinud. Suveräänsuse küsimus liigub küsimusest "kas ma usaldan seda tarnijat" küsimuseni "kus ma tahan seda käitada", ja teisele oskavad hankemeeskonnad juba vastata.

Kaks ausat mööndust. Esiteks ei ole GLM-5.3 kaalud veel väljas. Z.ai kuulutas mudeli välja 14. augustil ja lubas samas postituses "avaldada kaalud kaks nädalat pärast käivitamist, kui turvahindamine ja karastamine on lõpetatud". Sama otse on välja öeldud ka ootamise põhjus: "kui me järelõpet skaleerisime, arenes kübervõimekus kiiremini, kui ootasime." Kirjutamise hetkel ei ole avalikku GLM-5.3 kaalude hoidlat ja seega ei ole ka litsentsi, mida lugeda. Eelkäija GLM-5.2 on täna allalaaditav: 753 miljardit parameetrit MIT-litsentsi all ja ilma piirkondlike piiranguteta. Sama kordumine 5.3 puhul on põhjendatud ootus, mitte fakt. Teiseks ei kasutanud meie enda käivitus sellest midagi. Jõudsime GLM-5.3-ni OpenRouteri kaudu ja see on marsruutimisvalik, mitte andmete asukoha lahendus. Ise majutamine on see, mille avatud kaalud võimalikuks teevad; see ei ole see, mida meie tegime.

Mida see muudab

Meie jaoks on mudel seadistuslüliti — sama analüüsiahel töötab Claude'i, GPT, Gemini või GLM-iga ja iga käivituse etapp kasutab ainult valitud mootorit, ilma vaikse üleminekuta teisele teenusepakkujale. See on teadlik valik ja see võrdlus näitab, miks see loeb: organisatsioon, kes ei tohi dokumente väljapoole oma taristut saata, ei peaks seetõttu jääma halvema analüüsiga. Nende andmete järgi ta enam ei jäägi.

Z.ai enda avaldatud näitajad väidavad, et GLM-5.3 on valge kasti koodiülevaatuses ja haavatavuste leidmises Claude Mythos 5-ga võrdne; see on tootja enda number ja nii tuleb seda ka lugeda. Sõltumatud teated annavad talle Code Benchi testis 31,4% Opus 4.8 tulemuse 29,5% vastu ja CyberGymi haavatavuste ülesandes 84,5% Claude Mythos 5 tulemuse 83,8% vastu. Tipp on endiselt ees — Claude Fable 5 saavutab samas Code Benchi testis 39,5% — kuid "kaugel maas" ei kirjelda seda vahet enam.

Muutunud ei ole see, kes otsustab. Mõlemad käivitused lugesid läbi iga lehekülje pikast hankest ja pikast pakkumusest, mõlemad leidsid hinnaprobleemi, mille tõttu võib pakkumuse vormilisel alusel tagasi lükata, ja kumbki neist ei kirjuta millelegi alla. Spetsialist kontrollib tõendid ja jätab otsuse endale. See, kas avatud kaaludega mudel on piisavalt hea neid tõendeid ette valmistama, ei ole enam huvitav küsimus. Huvitav on see, kus te tahate seda käitada, kuni ta seda teeb.

Kuidas me lugesime

Mõlemad käivitused on eraldi tootmisanalüüsid samast pakkumusest sama hanke vastu, ühepäevase vahega, samade juhiste ja samade tööriistadega. GLM-i näitaja on kulu, mille OpenRouter iga päringu kohta teatas. Claude'i näitaja on arvutatud Anthropicu avaldatud määrade järgi, sealhulgas vahemälulugemise soodustus ja vahemälukirjutuse lisatasu, sest otsevastused hinda ei tagasta. Mõlemad hõlmavad ainult peaagenti ja kontrollietappi: kogu ahelas töötavad ka dokumentide indekseerimine ja nõudekaupa katvuse etapp, mis läks maksma rohkem kui need kaks etappi kokku ja mida GLM-i käivituses teenindas teine mudel, mistõttu kogu käivituse summad ei ole võrreldavad ja on siit välja jäetud. Üks käivitus kummagi kohta on andmepunkt, mitte mõõtmine. Meie mai võrdlus viie käivitusega mudeli kohta ette registreeritud vastusevõtme vastu on rangem mõõtmine.

Vaadake, kuidas tehisintellekt saab teie hangetes aidata.
Proovige esimest AI-analüüsi tasuta.
Registreeru tasuta

Allikad

  1. Claude API hinnad (Anthropic). Opus 4.8 ($5 / $25 miljoni tokeni kohta) ja Sonnet 4.6 ($3 / $15) määrade allikas, samuti vahemälulugemise ja -kirjutuse kordajate, mida kulu arvutamisel kasutati.
  2. GLM-5.3 — API hinnad ja pakkujad (OpenRouter). Määrade $1,40 sisend / $4,40 väljund / $0,26 vahemälulugemine ja 1 miljoni tokeni kontekstiakna allikas.
  3. Hinnad — Z.AI API platvorm (Z.AI arendajadokumentatsioon). Z.ai enda hinnakiri GLM-5.3 jaoks: $1,40 miljoni sisendtokeni kohta, $0,26 vahemällu pandud sisendi eest, $4,40 väljundi eest — samad määrad, mida küsib OpenRouter.
  4. GLM-5.3: tipptasemel kodeerimine uute kübervõimetega (Z.ai, 14. august 2026). Esmane teadaanne. Väljalaskekuupäeva, lubaduse "avaldada kaalud kaks nädalat pärast käivitamist, kui turvahindamine ja karastamine on lõpetatud" ning väite, et "kui me järelõpet skaleerisime, arenes kübervõimekus kiiremini, kui ootasime", allikas.
  5. zai-org/GLM-5.2 (Hugging Face). GLM-5.2 MIT-litsentsi, 753 miljardi parameetri ja 2026. aasta juuni väljalaske allikas.
  6. New Released — mudelite väljalaskemärkmed (Z.AI arendajadokumentatsioon). GLM-5.3 API-kättesaadavuse 18. augusti 2026 kirje ja Z.ai enda väite allikas, et mudel on valge kasti koodiülevaatuses ja haavatavuste leidmises Claude Mythos 5-ga võrdne.
  7. GLM 5.3: mõõtmised, hinnad ja kinnipeetud kaalud (Fello AI, august 2026). Teatatud Code Benchi ja CyberGymi näitajate allikas Claude Opus 4.8, Claude Mythos 5 ja Claude Fable 5 vastu.
  8. Võrdlesime Claude'i, GPT-d ja Geminit päris hangete peal (Tendergate, mai 2026). Meie varasem nelja mudeli võrdlus, sealhulgas GLM-5.2 usaldusväärsuse tõrked ja eespool mainitud Gemini kulutulemus.
Kuidas see postitus valmis

Me ehitame hangete jaoks tehisintellekti, seega oleks veidi imelik seda siin mitte kasutada. See postitus valmis koostöös: tehisintellekt luges väsimatult ja kirjutas esimesed mustandid, inimesed andsid hinnangu, tegid parandused ja ütlesid lõpliku jah-sõna.

Tagasi blogisse