Maijā mēs salīdzinājām četrus modeļus sintētiskā iepirkumā, un atvērto svaru pretendents — Zhipu GLM-5.2 — ieņēma pēdējo vietu uzticamības ziņā: tas pabeidza vienu izpildi no sešām, pārējās beidzās ar bojātu JSON. Trīs mēnešus vēlāk to pašu analīzi veicām divreiz reālam piedāvājumam — vienreiz ar Claude, vienreiz ar GLM-5.3 — un abas izpildes nonāca pie viena un tā paša slēdziena, nosauca tās pašas trīs problēmas un izmaksu ziņā atšķīrās par 17%. Cenrāžu atšķirība ir 3,6×.
Abas šīs puses ir svarīgas. Atvērto svaru modelis tagad ir patiesi konkurētspējīgs, un nauda, ko ietaupāt, pārejot uz to, ir daudz mazāka, nekā liek domāt tā cenrādis.
Ko mēs salīdzinājām
Dokumentu kopa bija reāls telekomunikāciju iepirkums — vidēja izmēra programmatūras platforma, 94 pārbaudāmas prasības, no kurām 40 obligātas — pret reāla pretendenta iesniegtu piedāvājumu. Abas puses esam anonimizējuši, jo iepirkums vēl ir atvērts. Atšķirībā no mūsu maija salīdzinājuma šeit nebija atbilžu atslēgas, tāpēc nevienu izpildi nevarēja novērtēt pret iepriekš sagatavotu defektu sarakstu. Divus ļoti atšķirīgus dzinējus var salīdzināt pēc tā, vai, lasot vienus un tos pašus dokumentus, tie nonāk pie viena un tā paša profesionālā vērtējuma.
Šo salīdzinājumu ierobežojām līdz diviem posmiem, kuros faktiski veidojas slēdziens: galvenais spriešanas aģents, kas lasa nolikumu un piedāvājumu un uzraksta atradumus, un verifikācijas posms, kas katru atradumu pārbauda pret avota dokumentiem, pirms tas nonāk pie lietotāja. Claude izpilde spriešanai izmantoja Opus 4.8 un verifikācijai Sonnet 4.6; GLM izpilde abiem izmantoja GLM-5.3, kam piekļuvām caur OpenRouter.
Cenrādis saka vienu
Uz miljonu tokenu šī nav līdzvērtīga sacensība:
Opus 4.8 maksā $5 par ievadi un $25 par izvadi; Sonnet 4.6 — $3 un $15; GLM-5.3 — $1,40 un $4,40. Izvades tokeniem tā ir 5,7× atšķirība pret Opus un 3,4× pret Sonnet.
Rēķins saka citu
Abos posmos kopā Claude izpilde izmaksāja $6,64 un GLM izpilde $5,52 — ietaupījums 17%, nevis 72%.
Atšķirība sarūk, jo GLM-5.3 bija nepieciešams daudz vairāk tokenu. Claude norēķinājās par 5,49 miljoniem tokenu 147 modeļa izsaukumos; GLM — par 9,42 miljoniem 223 izsaukumos. Uz vienu tokenu GLM bija 2,1× lētāks, bet tas izmantoja 1,7× vairāk, un abi efekti gandrīz pilnībā izlīdzinās.
To nosaka divas lietas. GLM-5.3 spriež daudz vairāk: 295 000 domāšanas tokenu pret Claude 17 000, tas ir septiņpadsmit reizes vairāk, un lielākā daļa no tā ir verifikācijas posmā. Un tā uzvednes kešatmiņa uzvedās atšķirīgi — Claude atkārtoti nolasīja kešoto prefiksu par desmito daļu no ievades cenas un maksāja piemaksu par tā ierakstīšanu, savukārt GLM izpildē tika reģistrēti 7,8 miljoni keša nolasījumu un neviena keša ierakstīšana. Keša ekonomika nav iespaidīga, taču tā ietekmē rēķinu vairāk nekā virsraksta likme.
Šo mēs izmērām jau otro reizi. Maijā Gemini 3.1 Pro bija zemākā cena uz tokenu no četriem modeļiem un vienlaikus visdārgākais faktiskajā izpildē, jo tas atkārtoti lasīja dokumentus pie katras prasības. Tokenu apetīte ir svarīgāka par tokenu cenu.
Slēdzieni sakrita
Abas izpildes atgrieza vienu un to pašu ieteikumu — iesniegt ar uzlabojumiem — un abas neatkarīgi identificēja tās pašas trīs nozīmīgākās problēmas piedāvājumā: nepilnīgu cenu tabulu, kas kādu mainīgu izmaksu izslēdza no fiksētās summas, ko pieprasīja nolikums; sertifikātu, ko pretendents deklarēja kā esošu, bet nepievienoja; un lielu daļu obligāto prasību, par kurām pretendents pats atzina, ka tās nebūs gatavas līdz iesniegšanas termiņam. Claude sagatavoja 12 atradumus, GLM — 11.
Pirmajā no tām abi nesaskanēja par smaguma pakāpi, nevis par būtību: Claude cenu problēmu nosauca par kritisku, GLM — par būtisku. Abi to izskaidroja vienādi, un abi atsaucās uz nolikuma punktu, kuram tā ir pretrunā.
Kur tie atšķīrās
Claude bija pilnīgāks. Tas atklāja divas vājās vietas, ko GLM nemaz nepieminēja — vājas pakalpojumu līmeņa saistības, kas sākas tikai pēc pirmā piegādes posma, un piegādes termiņus, kas klusi bija atkarīgi no pasūtītāja atbildes piecu darba dienu laikā. Neviena no tām piedāvājumu negremdētu; abas ir lietas, ko piedāvājuma vadītājs vēlētos zināt. Claude arī kvalifikācijas vārtu risku uzskatīja par verificētu būtisku atradumu, kur GLM to reģistrēja kā neverificētu mazāk būtisku.
GLM bija precīzāks. Kur Claude rakstīja, ka aptuveni 17 no apmēram 48 prasībām nav pieejamas, GLM precīzi saskaitīja obligāto apakškopu: 27 no 40, sadalot 12 daļēji izpildītās un 15 vēl neizstrādātās, un ielika procentus kopsavilkumā. Tas citēja precīzas līguma summas un iesniegšanas termiņu. Dokumentam, kas iepirkumu speciālistam būs jāaizstāv, šāda precizitāte ir vērtīga.
GLM arī joprojām vienreiz salūza. Vienā prasībā tas izvadīja 98 kilobaitus garu nenoslēgtu virkni, un šī pārbaude neizdevās pilnībā. Tas ir tas pats kļūmes veids, kas maijā nogalināja piecas no sešām GLM-5.2 izpildēm — bet no letāla tas kļuva par vienu izlaistu vienību no 94. Uzticamības problēma ir samazinājusies līdz nelīdzenumam.
Pirms trim mēnešiem atvērto svaru modelis nespēja pabeigt darbu. Tagad tas strīdas ar priekšgala modeli par smaguma pakāpi un uzvar aritmētikā.
Tā daļa, par ko visi patiesībā jautā
Neviens Eiropas publiskajos iepirkumos nevēlas dzirdēt, ka viņu iepirkuma dokumenti nosūtīti uz Ķīnas API. Bažas ir pamatotas, un tām ir maz kopīga ar modeļa kvalitāti. Tās ir par to, kur dokumenti nonāk un kuras valsts juridiskās prasības sniedzas līdz uzņēmumam, kas tos glabā. Pasūtītājam, kas apstrādā komerciāli sensitīvus piedāvājumus, šis iebildums izbeidz sarunu.
Atvērtie svari maina šī iebilduma formu, jo modelis vairs nav pakalpojums, bet gan fails. Svari, ko var lejupielādēt, darbojas uz aparatūras, kuru kontrolējat jūs, vai pie Eiropas pakalpojuma sniedzēja, ko jau esat pārbaudījuši. Suverenitātes jautājums pārvietojas no "vai es uzticos šim piegādātājam" uz "kur es vēlos to darbināt", un iepirkumu komandas jau zina, kā atbildēt uz otro.
Divi godīgi iebildumi. Pirmkārt, GLM-5.3 svari vēl nav publicēti. Z.ai modeli izziņoja 14. augustā un tajā pašā rakstā apņēmās "publicēt svarus divas nedēļas pēc izlaišanas, tiklīdz būs pabeigta drošības izvērtēšana un nostiprināšana". Tikpat tieši ir pateikts arī iemesls: "līdz ar pēcapmācības mērogošanu kiberspējas attīstījās straujāk, nekā bijām gaidījuši." Šī raksta tapšanas brīdī publiska GLM-5.3 svaru repozitorija nav, tātad nav arī licences, ko izlasīt. Priekštecis GLM-5.2 ir lejupielādējams jau šodien: 753 miljardi parametru ar MIT licenci un bez reģionāliem ierobežojumiem. Tas pats attiecībā uz 5.3 ir pamatota gaida, nevis fakts. Otrkārt, mūsu pašu izpilde neko no tā neizmantoja. GLM-5.3 mēs piekļuvām caur OpenRouter, un tā ir maršrutēšanas izvēle, nevis datu atrašanās vietas risinājums. Pašhostēšana ir tas, ko atvērtie svari padara iespējamu; tas nav tas, ko mēs darījām.
Ko tas maina
Mums modelis ir konfigurācijas slēdzis — viena un tā pati analīzes plūsma darbojas ar Claude, GPT, Gemini vai GLM, un katrs izpildes posms izmanto tikai izvēlēto dzinēju, bez klusas pārslēgšanās uz citu pakalpojuma sniedzēju. Tas ir apzināti, un šis salīdzinājums parāda, kāpēc tas ir svarīgi: organizācijai, kas nevar sūtīt dokumentus ārpus savas infrastruktūras, tāpēc nevajadzētu palikt ar sliktāku analīzi. Pēc šiem datiem tai vairs nav jāpaliek.
Z.ai pašu publicētie rādītāji apgalvo, ka GLM-5.3 līdzinās Claude Mythos 5 baltās kastes koda pārskatīšanā un ievainojamību atklāšanā; tas ir paša ražotāja skaitlis, un tā arī jālasa. Neatkarīgi ziņojumi tam Code Bench testā piedēvē 31,4% pret Opus 4.8 rezultātu 29,5% un CyberGym ievainojamību uzdevumā 84,5% pret Claude Mythos 5 rezultātu 83,8%. Priekšgals joprojām ir priekšā — Claude Fable 5 tajā pašā Code Bench testā sasniedz 39,5% — bet "tālu aiz muguras" vairs neapraksta šo starpību.
Nav mainījies tas, kas izlemj. Abas izpildes izlasīja katru lappusi garā nolikumā un garā piedāvājumā, abas atrada cenu problēmu, kuras dēļ piedāvājumu varētu noraidīt formāla iemesla dēļ, un neviena no tām neko neparaksta. Speciālists pārbauda pierādījumus un patur lēmumu. Vai atvērto svaru modelis ir pietiekami labs, lai sagatavotu šos pierādījumus, vairs nav interesantākais jautājums. Interesantākais ir, kur jūs vēlaties to darbināt, kamēr tas to dara.
Kā mēs skaitījām
Abas izpildes ir atsevišķas produkcijas analīzes vienam un tam pašam piedāvājumam pret vienu un to pašu iepirkumu, ar vienas dienas starpību, ar vienām un tām pašām uzvednēm un rīkiem. GLM skaitlis ir izmaksas, ko par katru izsaukumu ziņoja OpenRouter. Claude skaitlis ir aprēķināts no Anthropic publicētajām likmēm, ieskaitot keša nolasīšanas atlaidi un keša ierakstīšanas piemaksu, jo tiešās API atbildes cenu neatgriež. Abi attiecas tikai uz galveno aģentu un verifikācijas posmu: pilnajā plūsmā darbojas arī dokumentu indeksēšana un prasību pārklājuma posms, kas izmaksāja vairāk nekā šie divi posmi kopā un ko GLM izpildē apkalpoja cits modelis, tāpēc pilnas izpildes kopsummas nav salīdzināmas un šeit nav iekļautas. Viena izpilde katram ir datu punkts, nevis mērījums. Mūsu maija salīdzinājums ar piecām izpildēm katram modelim pret iepriekš reģistrētu atbilžu atslēgu ir stingrāks mērījums.
Izmēģiniet pirmo MI analīzi bez maksas.
Avoti
- Claude API cenas (Anthropic). Avots Opus 4.8 ($5 / $25 par miljonu tokenu) un Sonnet 4.6 ($3 / $15) likmēm, kā arī keša nolasīšanas un ierakstīšanas koeficientiem, kas izmantoti izmaksu aprēķinā.
- GLM-5.3 — API cenas un pakalpojuma sniedzēji (OpenRouter). Avots $1,40 ievades / $4,40 izvades / $0,26 keša nolasīšanas likmēm un 1 miljona tokenu konteksta logam.
- Cenas — Z.AI API platforma (Z.AI izstrādātāju dokumentācija). Z.ai pašu cenrādis GLM-5.3: $1,40 par miljonu ievades tokenu, $0,26 par kešoto ievadi, $4,40 par izvadi — tās pašas likmes, ko piemēro OpenRouter.
- GLM-5.3: progresīva kodēšana ar jaunām kiberspējām (Z.ai, 2026. gada 14. augusts). Primārais paziņojums. Avots izlaišanas datumam, apņēmībai "publicēt svarus divas nedēļas pēc izlaišanas, tiklīdz būs pabeigta drošības izvērtēšana un nostiprināšana", un apgalvojumam, ka "līdz ar pēcapmācības mērogošanu kiberspējas attīstījās straujāk, nekā bijām gaidījuši".
- zai-org/GLM-5.2 (Hugging Face). Avots GLM-5.2 MIT licencei, 753 miljardu parametru skaitam un 2026. gada jūnija izlaidumam.
- Jaunumi — modeļu izlaidumu piezīmes (Z.AI izstrādātāju dokumentācija). Avots 2026. gada 18. augusta ierakstam par GLM-5.3 pieejamību API un Z.ai pašu apgalvojumam, ka modelis līdzinās Claude Mythos 5 baltās kastes koda pārskatīšanā un ievainojamību atklāšanā.
- GLM 5.3: mērījumi, cenas un aizturētie svari (Fello AI, 2026. gada augusts). Avots ziņotajiem Code Bench un CyberGym rādītājiem pret Claude Opus 4.8, Claude Mythos 5 un Claude Fable 5.
- Mēs salīdzinājām Claude, GPT un Gemini reālos iepirkumos (Tendergate, 2026. gada maijs). Mūsu iepriekšējais četru modeļu salīdzinājums, tostarp GLM-5.2 uzticamības kļūmes un iepriekš minētais Gemini izmaksu rezultāts.
Mēs veidojam mākslīgo intelektu iepirkumiem, tāpēc būtu mazliet dīvaini to neizmantot arī šeit. Šis raksts tapis kopīgi: mākslīgais intelekts - nenogurstoša lasīšana un pirmie melnraksti, cilvēki - vērtējums, labojumi un gala vārds.