Gegužę palyginome keturis modelius sintetiniame pirkime, ir atvirųjų svorių dalyvis — Zhipu GLM-5.2 — pagal patikimumą buvo paskutinis: jis užbaigė vieną vykdymą iš šešių, kiti nutrūko dėl netaisyklingo JSON. Po trijų mėnesių tą pačią analizę atlikome dukart realiam pasiūlymui — vieną kartą su Claude, kitą su GLM-5.3 — ir abu vykdymai priėjo prie tos pačios išvados, nurodė tas pačias tris problemas, o kaina skyrėsi 17%. Kainoraščiai skiriasi 3,6×.
Abi šios dalys svarbios. Atvirųjų svorių modelis dabar tikrai konkurencingas, o pinigai, kuriuos sutaupote pereidami prie jo, yra kur kas mažesni, nei rodo jo kainoraštis.
Ką lyginome
Dokumentų rinkinys buvo realus telekomunikacijų pirkimas — vidutinio dydžio programinės įrangos platforma, 94 tikrinamos sąlygos, iš kurių 40 privalomų — prieš realaus dalyvio pateiktą pasiūlymą. Abi šalis anonimizavome, nes pirkimas dar vyksta. Kitaip nei gegužės palyginime, čia nebuvo atsakymų rakto, todėl nė vieno vykdymo nebuvo galima įvertinti pagal iš anksto paruoštą defektų sąrašą. Du labai skirtingus varikliukus galima lyginti pagal tai, ar, skaitydami tuos pačius dokumentus, jie priima tą patį profesinį sprendimą.
Šį palyginimą apribojome dviem etapais, kuriuose iš tikrųjų formuojasi išvada: pagrindinis mąstymo agentas, kuris skaito pirkimo dokumentus ir pasiūlymą bei parašo radinius, ir patikros etapas, kuris kiekvieną radinį iš naujo sutikrina su pirminiais dokumentais prieš tai, kai jis pasiekia naudotoją. Claude vykdymas mąstymui naudojo Opus 4.8, o patikrai Sonnet 4.6; GLM vykdymas abiem naudojo GLM-5.3, prie kurio prisijungėme per OpenRouter.
Kainoraštis sako viena
Vienam milijonui žetonų tai nėra lygi kova:
Opus 4.8 kainuoja $5 už įvestį ir $25 už išvestį; Sonnet 4.6 — $3 ir $15; GLM-5.3 — $1,40 ir $4,40. Išvesties žetonams tai 5,7× skirtumas prieš Opus ir 3,4× prieš Sonnet.
Sąskaita sako kita
Abiejuose etapuose kartu Claude vykdymas kainavo $6,64, o GLM vykdymas $5,52 — 17%, o ne 72% sutaupymas.
Skirtumas susitraukia, nes GLM-5.3 prireikė kur kas daugiau žetonų. Claude apmokestino 5,49 milijono žetonų per 147 modelio užklausas; GLM — 9,42 milijono per 223. Vienam žetonui GLM buvo 2,1× pigesnis, bet jų sunaudojo 1,7× daugiau, ir abu poveikiai beveik visiškai vienas kitą atsveria.
Tai lemia du dalykai. GLM-5.3 mąsto gerokai daugiau: 295 000 mąstymo žetonų prieš Claude 17 000, tai septyniolika kartų daugiau, ir didžioji dalis to yra patikros etape. Ir jo užklausų podėlis veikė kitaip — Claude iš naujo perskaitė podėlyje esantį prefiksą už dešimtąją įvesties kainos dalį ir mokėjo priemoką už jo įrašymą, o GLM vykdyme užregistruota 7,8 milijono podėlio skaitymų ir nė vieno podėlio įrašymo. Podėlio ekonomika nėra įspūdinga, tačiau ji sąskaitą keičia labiau nei antraštinė kaina.
Tai jau antras kartas, kai tai išmatuojame. Gegužę Gemini 3.1 Pro turėjo mažiausią kainą už žetoną iš keturių modelių ir kartu buvo brangiausias faktiškai vykdant, nes prie kiekvienos sąlygos dokumentus skaitė iš naujo. Žetonų apetitas svarbesnis už žetono kainą.
Išvados sutapo
Abu vykdymai grąžino tą pačią rekomendaciją — teikti su pagerinimais — ir abu nepriklausomai nustatė tas pačias tris svarbiausias pasiūlymo problemas: nepilną kainų lentelę, kuri kintamą išlaidą išbraukė iš fiksuotos sumos, kurios reikalavo pirkimo dokumentai; sertifikatą, kurį dalyvis deklaravo turįs, bet nepridėjo; ir didelę dalį privalomų sąlygų, kurių, kaip pats dalyvis pripažino, iki pateikimo termino nebus įgyvendinta. Claude parengė 12 radinių, GLM — 11.
Dėl pirmosios iš jų abu nesutarė dėl sunkumo, o ne dėl esmės: Claude kainos problemą pavadino kritine, GLM — reikšminga. Abu ją paaiškino vienodai ir abu nurodė pirkimo dokumentų punktą, kuriam ji prieštarauja.
Kur jie išsiskyrė
Claude buvo išsamesnis. Jis atskleidė dvi silpnas vietas, kurių GLM visiškai nepaminėjo — silpnus paslaugų lygio įsipareigojimus, prasidedančius tik po pirmojo pristatymo etapo, ir pristatymo datas, kurios tyliai buvo priklausomos nuo pirkėjo atsakymo per penkias darbo dienas. Nė viena iš jų pasiūlymo nenugramzdintų; abi yra tai, ką pasiūlymo vadovas norėtų žinoti. Claude taip pat kvalifikacijos vartų riziką laikė patikrintu reikšmingu radiniu, o GLM ją įrašė kaip nepatikrintą mažesnės svarbos.
GLM buvo tikslesnis. Kai Claude rašė, kad maždaug 17 iš apytiksliai 48 sąlygų nėra prieinamos, GLM tiksliai suskaičiavo privalomąjį poaibį: 27 iš 40, iš kurių 12 įgyvendinta dalinai ir 15 dar nesukurta, ir procentą įrašė į suvestinę. Jis pacitavo tikslias sutarties sumas ir pateikimo terminą. Dokumentui, kurį pirkimų specialistui teks apginti, toks tikslumas yra vertingas.
GLM taip pat vieną kartą vis dar sugedo. Prie vienos sąlygos jis išvedė 98 kilobaitų neuždarytą eilutę ir ta patikra nepavyko visiškai. Tai tas pats gedimo tipas, kuris gegužę pražudė penkis iš šešių GLM-5.2 vykdymų — bet iš mirtino jis tapo vienu praleistu punktu iš 94. Patikimumo problema susitraukė iki nelygumo.
Prieš tris mėnesius atvirųjų svorių modelis negalėjo užbaigti darbo. Dabar jis nesutinka su priešakiniu modeliu dėl sunkumo ir nugali aritmetikoje.
Ta dalis, apie kurią visi iš tikrųjų klausia
Niekas Europos viešuosiuose pirkimuose nenori išgirsti, kad jų pirkimo dokumentai buvo išsiųsti į Kinijos API. Susirūpinimas pagrįstas ir su modelio kokybe susijęs mažai. Jis yra apie tai, kur dokumentai atsiduria ir kurios valstybės teisiniai reikalavimai pasiekia įmonę, kuri juos saugo. Pirkėjui, dirbančiam su komerciškai jautriais pasiūlymais, šis prieštaravimas užbaigia pokalbį.
Atvirieji svoriai pakeičia šio prieštaravimo formą, nes modelis nustoja būti paslauga ir tampa failu. Svoriai, kuriuos galima atsisiųsti, veikia jūsų kontroliuojamoje įrangoje arba pas Europos teikėją, kurį jau esate patikrinę. Suverenumo klausimas pasikeičia iš "ar aš pasitikiu šiuo tiekėju" į "kur noriu tai vykdyti", o į antrąjį pirkimų komandos jau moka atsakyti.
Du sąžiningi prieštaravimai. Pirma, GLM-5.3 svoriai dar nepaskelbti. Z.ai modelį paskelbė rugpjūčio 14 d. ir tame pačiame įraše įsipareigojo "išleisti svorius praėjus dviem savaitėms po pristatymo, kai bus baigtas saugumo įvertinimas ir sutvirtinimas". Lygiai taip pat tiesiai nurodyta ir priežastis: "plečiant mokymą po treniruotės, kibernetiniai gebėjimai išsivystė greičiau, nei tikėjomės." Šio teksto rašymo metu viešos GLM-5.3 svorių saugyklos nėra, taigi nėra ir licencijos, kurią būtų galima perskaityti. Pirmtakas GLM-5.2 atsisiunčiamas jau šiandien: 753 milijardai parametrų su MIT licencija ir be regioninių ribojimų. Tas pats dėl 5.3 yra pagrįstas lūkestis, o ne faktas. Antra, mūsų pačių vykdymas nieko iš to nenaudojo. Prie GLM-5.3 prisijungėme per OpenRouter, o tai yra maršruto pasirinkimas, ne duomenų buvimo vietos sprendimas. Savarankiškas talpinimas yra tai, ką atvirieji svoriai padaro galimu; tai nėra tai, ką padarėme mes.
Ką tai pakeičia
Mums modelis yra konfigūracijos jungtukas — ta pati analizės eiga veikia su Claude, GPT, Gemini ar GLM, ir kiekvienas vykdymo etapas naudoja tik pasirinktą variklį, be tylaus perėjimo prie kito teikėjo. Tai sąmoninga, ir šis palyginimas parodo, kodėl tai svarbu: organizacijai, kuri negali siųsti dokumentų už savo infrastruktūros ribų, dėl to neturėtų likti blogesnė analizė. Pagal šiuos duomenis jai jau nebelieka.
Patys Z.ai skelbiami rodikliai teigia, kad GLM-5.3 prilygsta Claude Mythos 5 baltosios dėžės kodo peržiūroje ir pažeidžiamumų paieškoje; tai paties gamintojo skaičius ir taip jį reikia skaityti. Nepriklausomi pranešimai jam Code Bench teste priskiria 31,4% prieš Opus 4.8 rezultatą 29,5% ir CyberGym pažeidžiamumų užduotyje 84,5% prieš Claude Mythos 5 rezultatą 83,8%. Priešakis vis dar priekyje — Claude Fable 5 tame pačiame Code Bench teste pasiekia 39,5% — bet "toli atsilikęs" šio skirtumo jau nebeaprašo.
Nepasikeitė tai, kas sprendžia. Abu vykdymai perskaitė kiekvieną ilgų pirkimo dokumentų ir ilgo pasiūlymo lapą, abu rado kainos problemą, dėl kurios pasiūlymas galėtų būti atmestas formaliu pagrindu, ir nė vienas iš jų nieko nepasirašo. Specialistas patikrina įrodymus ir sprendimą pasilieka sau. Ar atvirųjų svorių modelis pakankamai geras šiems įrodymams parengti, jau nebėra įdomiausias klausimas. Įdomiausia yra tai, kur norite jį vykdyti, kol jis tai daro.
Kaip skaičiavome
Abu vykdymai yra atskiros produkcinės to paties pasiūlymo analizės prieš tą patį pirkimą, vienos dienos skirtumu, su tomis pačiomis užklausomis ir tais pačiais įrankiais. GLM skaičius yra kaina, kurią už kiekvieną užklausą pateikė OpenRouter. Claude skaičius apskaičiuotas pagal Anthropic skelbiamas kainas, įskaitant podėlio skaitymo nuolaidą ir podėlio įrašymo priemoką, nes tiesioginės API atsakymai kainos negrąžina. Abu apima tik pagrindinį agentą ir patikros etapą: visoje eigoje taip pat veikia dokumentų indeksavimas ir sąlygų aprėpties etapas, kuris kainavo daugiau nei šie du etapai kartu ir kurį GLM vykdyme aptarnavo kitas modelis, todėl viso vykdymo sumos nėra lyginamos ir čia neįtrauktos. Vienas vykdymas kiekvienam yra duomenų taškas, o ne matavimas. Mūsų gegužės palyginimas su penkiais vykdymais kiekvienam modeliui prieš iš anksto registruotą atsakymų raktą yra tikslesnis matavimas.
Išbandykite pirmąją DI analizę nemokamai.
Šaltiniai
- Claude API kainos (Anthropic). Opus 4.8 ($5 / $25 už milijoną žetonų) ir Sonnet 4.6 ($3 / $15) kainų šaltinis, taip pat podėlio skaitymo ir įrašymo koeficientų, naudotų kainai apskaičiuoti.
- GLM-5.3 — API kainos ir teikėjai (OpenRouter). $1,40 įvesties / $4,40 išvesties / $0,26 podėlio skaitymo kainų ir 1 milijono žetonų konteksto lango šaltinis.
- Kainos — Z.AI API platforma (Z.AI kūrėjų dokumentacija). Paties Z.ai kainoraštis GLM-5.3: $1,40 už milijoną įvesties žetonų, $0,26 už podėlyje esančią įvestį, $4,40 už išvestį — tos pačios kainos, kurias taiko OpenRouter.
- GLM-5.3: pažangus kodavimas su naujomis kibernetinėmis galimybėmis (Z.ai, 2026 m. rugpjūčio 14 d.). Pirminis pranešimas. Išleidimo datos, įsipareigojimo "išleisti svorius praėjus dviem savaitėms po pristatymo, kai bus baigtas saugumo įvertinimas ir sutvirtinimas" bei teiginio, kad "plečiant mokymą po treniruotės, kibernetiniai gebėjimai išsivystė greičiau, nei tikėjomės", šaltinis.
- zai-org/GLM-5.2 (Hugging Face). GLM-5.2 MIT licencijos, 753 milijardų parametrų ir 2026 m. birželio išleidimo šaltinis.
- Naujienos — modelių išleidimo pastabos (Z.AI kūrėjų dokumentacija). 2026 m. rugpjūčio 18 d. įrašo apie GLM-5.3 prieinamumą API ir paties Z.ai teiginio, kad modelis prilygsta Claude Mythos 5 baltosios dėžės kodo peržiūroje ir pažeidžiamumų paieškoje, šaltinis.
- GLM 5.3: matavimai, kainos ir sulaikyti svoriai (Fello AI, 2026 m. rugpjūtis). Skelbiamų Code Bench ir CyberGym rodiklių prieš Claude Opus 4.8, Claude Mythos 5 ir Claude Fable 5 šaltinis.
- Palyginome Claude, GPT ir Gemini realiuose pirkimuose (Tendergate, 2026 m. gegužė). Ankstesnis mūsų keturių modelių palyginimas, įskaitant GLM-5.2 patikimumo gedimus ir pirmiau minėtą Gemini kainos rezultatą.
Kuriame dirbtinį intelektą viešiesiems pirkimams, tad būtų kiek keista juo nesinaudoti ir čia. Šį įrašą rašėme kartu: dirbtinis intelektas - nenuilstantis skaitymas ir pirmieji juodraščiai, žmonės - vertinimas, pataisymai ir galutinis žodis.