Liigu põhisisu juurde
Sama pakkumuse analüüs GLM-5.3 Flashi ja astmelise Claude'i konfiguratsiooniga
03. september 2026

Sama pakkumuse analüüs GLM-5.3 Flashi ja astmelise Claude'i konfiguratsiooniga

Käivitasime sama analüüsi kaks korda: üks hange, üks pakkumus, sama analüüsiahel, samad juhised. Esimene käivitus kasutas Claude'i — Opus 4.8 arutlemiseks, Sonnet 4.6 kontrollimiseks, Haiku 4.5 nõuete ükshaaval läbilugemiseks. 2 tundi 11 minutit, $36,13. Teine kasutas kõigi kolme töö jaoks GLM-5.3 Flashi, OpenRouteri kaudu. 10 tundi 18 minutit, $4,82.

Mõlemad andsid analüüsi, mille me pakkumuse juhile saadaksime, ja mõlemad jõudsid sama soovituseni. Neid ei erista hinnanguvõime. Neid eristab arve ja usaldusväärsus.

GLM-5.3 Flash
$4,82
kõik etapid ühel mudelil
7,5×
kuluvahe
Claude astmeline
$36,13
Opus 4.8 / Sonnet 4.6 / Haiku 4.5
Sama
üldsoovitus, milleni mõlemad käivitused üksteisest sõltumatult jõudsid
11 / 16
hindamiskriteeriumi, mida mõlemad käivitused hindasid ühtemoodi
4,7×
aeglasem — 10 h 18 min 2 h 11 min vastu, peaaegu kogu vahe on teenusepakkuja viivitus

1. Mida me käivitasime

Riigihange mitmes osas ja terviklik pakkumus selle vastu: 210 faili, lepingu maksumus seitsmekohaline aastas. Pakkumus on välja mõeldud — kirjutasime selle ise ja tegime nii päris esitatud pakkumuse sarnaseks, kui suutsime. Hankijat ega valdkonda me ei nimeta.

Mõlemad käivitused kasutasid identset analüüsiahelat — indekseerimine, peamine arutlusagent, katvuse etapp, mis kontrollib iga nõuet, kriteeriumi ja osa paralleelselt, kontrollikäik, mis loeb iga leiu algdokumendi vastu üle, ja registrikontroll iga pakkumuses nimetatud ettevõtte ja isiku kohta. Ainus erinevus oli see, milline mootor millist etappi teenindas.

2. Mõlemad käivitused tegid töö ära

Sama soovitus ja üksmeel kuueteistkümnest hindamiskriteeriumist üheteistkümne osas. Mõlemad tabasid üksteisest sõltumatult pakkuja enda deklareeritud protsendi, mis pakkumuse enda arvudest välja ei tule, ja võõrkeelse dokumendi, mis esitati ilma kinnitatud tõlketa. Erinevus on selles, kui raskeks nad leitut pidasid.

Mudeli koostatud leiud raskusastme järgi
Ei sisalda registrikontrolli leide, mille annab determineeritud kontroll, mitte mudel.
GLM-5.3 Flash 11
Claude astmeline 9
kriitiline oluline vähemoluline tugevus

GLM-5.3 Flash tõstis tooni sagedamini. See hindas kolm puudust kriitiliseks seal, kus Claude'i käivitus kandis võrreldavad probleemid madalamale või jättis kriteeriumi inimese otsustada. Raskusaste on hinnanguline otsus ja kumbki kaalumine ei ole ilmselgelt õige — pakkumuse juhti, kes tahab iga vormilise pisiasja kohta valju märguannet, teenindab paremini esimene, ja seda, kes tahab lühikest nimekirja päris takistustest, teine. Mõlemad on samade dokumentide kaitstavad tõlgendused.

Peaagendi tööriistakutsed
Arutlusagendi tehtud shelli-, faililugemis-, grep-, pildieraldus- ja salvestuskutsed.
GLM-5.3 Flash 123
Claude Opus 4.8 68

Odavam mudel tegi sama kohta jõudmiseks rohkem tööd. 28 shellikäsku, 15 faililugemist, 12 pildieraldust ja 7 grepi Opuse 11, 5, 3 ja mitte ühegi vastu — ühel hetkel avas see dokumendi aluseks oleva XML-i, et märkeruudu olekut otse lugeda. Just tokeni kohta odav olemine lubas tal seda endale võimaldada.

3. Arve

Teenusepakkuja kulu etappide kaupa, kogu käivitus
Claude'i näitajad on arvutatud Anthropicu avaldatud määrade järgi koos vahemälukordajatega; GLM-i näitajad on kulu, mille OpenRouter iga päringu kohta teatas.
Nõuded $17,39
$2,23
Peaagent $5,94
$1,06
Kontroll $5,94
$0,44
Kriteeriumid $4,25
$0,78
Osad $1,50
$0,13
Piltide lugemine $1,12
$0,19
Claude astmeline GLM-5.3 Flash

Ainuüksi nõudekaupa etapp läks Claude'i peal maksma rohkem ($17,39) kui kogu GLM-i käivitus ($4,82). See etapp töötab Haiku peal, Anthropicu odaval astmel. Odav aste on odav ainult oma pere kõrval.

GLM-i tokeniisu on endiselt alles: 2,98 miljonit väljundtokenit ja 2,13 miljonit mõtlemistokenit Claude'i 0,85 ja 0,10 miljoni vastu, umbes viis korda rohkem kirjutamist vastuseni jõudmiseks. Augustis sõi see isu 3,6× hinnavahe 17%-ni kokku. Seekord oli vahe piisavalt lai, et see ära neelata.

Kuhu kumbki käivitus oma mudelipäringud kulutas
Päringute koguarv etapi kohta kogu käivituse jooksul. Mõlemad käivitused, sama analüüsiahel.
Claude: Haiku 4.5 1251
Claude: Sonnet 4.6 219
Claude: Opus 4.8 28
GLM-5.3 Flash 1345
Suurema osa lugemisest teeb teie kiire aste

Opus tegi astmelise käivituse 1498 mudelipäringust 28. Haiku tegi 1251 ja võttis $36-st $23. Astmeline jaotus on tavapraktika ja just seetõttu maksis see käivitus $36, mitte umbes $130, nagu läbivate Opuse määradega oleks läinud, kuid süstemaatilist nõudekaupa läbikäiku teenindab virna kõige odavam mudel. Selle valimine väärib sama tähelepanelikkust kui pealkirjamudeli valimine.

4. Usaldusväärsus

Siin maksab odav käivitus enda eest tagasi vales valuutas. 10 h 18 min 2 h 11 min vastu ja peaaegu mitte midagi sellest vahest ei ole lisamõtlemine — käivitus seisis jõude 14 kuni 78 minuti kaupa, oodates teenusepakkuja võimsust. See näitab pigem seda, kui koormatud on marsruuditud lõpp-punkt ühel konkreetsel pärastlõunal, kui midagi mudeli kaalude kohta, kuid spetsialist, kes alustab analüüsi enne lõunat ja loodab seda pärast lugeda, paneb selle tähele.

GLM läheb ka ikka veel JSON-i peal katki. Üks katvustööline suri tööriistakutse keskel lõpetamata stringi tõttu ja üks päring vajas kordamist, mis maksis komplektist ühe kontrollimata nõude. See on sama tõrketüüp, mis tappis viis kuuest GLM-5.2 käivitusest, kui me seda mais esimest korda võrdlesime. Surmavast on saanud üks vahele jäänud punkt, kuid kuhugi see kadunud ei ole.

Ka Claude'i käivitus ei olnud laitmatu: üks osa kontrolliv tööline katkes pärast viit järjestikust tööriistaviga ja tuli samamoodi maha kanda. Kummalgi üks vahele jäänud punkt, erinevatel põhjustel.

5. Mida me sellest järeldame

Üks käivitus kummagi kohta ei ole mõõtmine ja aus kokkuvõte on tagasihoidlik. Kaks mootorit, mille hinnad erinevad seitse korda, tegid sama töö võrreldaval tasemel ära, olid raskusastme osas eri meelt viisil, mille inimülevaataja niikuinii lahendaks, ja erinesid kõige rohkem selles, kui kaua te ootate ja kui sageli midagi vahele jääb.

Meie jaoks on mootor seadistuslüliti — sama analüüsiahel töötab Claude'i, GPT, Gemini või GLM-iga ja iga etapp kasutab teie valitud mootorit, ilma vaikse asendamiseta. Kui etapp võib vaikselt odavamale mudelile üle minna, ei saa te teada, mida teie analüüs tegelikult nägi. See loeb rohkem kui see, kumma neist kahest te valite.

6. Kuidas me lugesime

Mõlemad käivitused on üksikud tootmisanalüüsid samast pakkumusest sama hanke vastu, samade juhiste, tööriistade ja dokumentidega. GLM-i näitaja on kulu, mille OpenRouter iga päringu kohta teatas, kokku liidetuna. Claude'i näitaja on arvutatud Anthropicu avaldatud määrade järgi, sealhulgas vahemälulugemise soodustus ja vahemälukirjutuse lisatasu, sest otsevastused hinda ei tagasta. Leidude arvud eristavad läbivalt mudeli koostatud leide registrikontrollist. Meie mai võrdlus viie käivitusega mudeli kohta on suurem valim.

Vaadake, kuidas tehisintellekt saab teie hangetes aidata.
Proovige esimest AI-analüüsi tasuta.
Registreeru tasuta

Allikad

  1. Claude API hinnad (Anthropic). Opus 4.8, Sonnet 4.6 ja Haiku 4.5 miljoni tokeni määrade allikas, samuti vahemälulugemise ja -kirjutuse kordajate, mida kasutati $36,13 arvutamiseks.
  2. Hiina avatud kaaludega mudelid on hankeanalüüsis järele jõudnud (Tendergate, august 2026). Meie eelmine täismahus GLM-5.3 ja Claude'i võrdlus, 3,6× hinnakirja vahe allikas, millest sai 17% arvevahe.
  3. Võrdlesime Claude'i, GPT-d ja Geminit päris hangete peal (Tendergate, mai 2026). Meie nelja mudeli võrdlus, GLM-5.2 vigase JSON-i usaldusväärsustõrgete allikas.
Kuidas see postitus valmis

Me ehitame hangete jaoks tehisintellekti, seega oleks veidi imelik seda siin mitte kasutada. See postitus valmis koostöös: tehisintellekt luges väsimatult ja kirjutas esimesed mustandid, inimesed andsid hinnangu, tegid parandused ja ütlesid lõpliku jah-sõna.

Tagasi blogisse