Vienu un to pašu analīzi veicām divreiz: viens iepirkums, viens piedāvājums, viena un tā pati plūsma, tās pašas uzvednes. Pirmajā izpildē izmantojām Claude — Opus 4.8 spriešanai, Sonnet 4.6 verifikācijai, Haiku 4.5 prasību lasīšanai vienu pēc otras. 2 stundas 11 minūtes, $36,13. Otrajā visiem trim darbiem izmantojām GLM-5.3 Flash caur OpenRouter. 10 stundas 18 minūtes, $4,82.
Abas sagatavoja analīzi, ko mēs nosūtītu piedāvājuma vadītājam, un abas nonāca pie viena un tā paša ieteikuma. Tās šķir nevis spriestspēja. Tās šķir rēķins un uzticamība.
1. Ko mēs izpildījām
Publisks iepirkums vairākās daļās un pilns piedāvājums pret to: 210 faili, līgumcena septiņos ciparos gadā. Piedāvājums ir izdomāts — mēs to uzrakstījām paši un padarījām pēc iespējas tuvāku reālam iesniegumam. Pasūtītāju un nozari nenosaucam.
Abas izpildes izmantoja identisku plūsmu — indeksēšanu, galveno spriešanas aģentu, pārklājuma posmu, kas paralēli pārbauda katru prasību, kritēriju un iepirkuma daļu, verifikācijas caurlaidi, kas katru atradumu pārlasa pret avotu, un katra piedāvājumā nosauktā uzņēmuma un cilvēka pārbaudi reģistros. Vienīgā atšķirība bija tā, kurš dzinējs apkalpoja kuru posmu.
2. Abas izpildes paveica darbu
Viens un tas pats ieteikums un sakritība vienpadsmit no sešpadsmit vērtēšanas kritērijiem. Abas neatkarīgi pamanīja pašdeklarētu procentu, kas no paša piedāvājuma skaitļiem neizrēķinās, un svešvalodā iesniegtu dokumentu bez apliecināta tulkojuma. Atšķiras tas, cik smagi katra novērtēja atrasto.
GLM-5.3 Flash biežāk cēla smaguma pakāpi. Tas trīs defektus novērtēja kā kritiskus tur, kur Claude izpilde līdzīgas problēmas reģistrēja zemāk vai atstāja kritēriju izlemšanai cilvēkam. Smaguma pakāpe ir vērtējuma jautājums, un neviens no abiem svērumiem nav acīmredzami pareizais — piedāvājuma vadītājam, kurš vēlas, lai skaļi tiktu iezīmēta katra formalitāte, labāk noder pirmais, bet tam, kurš vēlas īsu sarakstu ar īstiem šķēršļiem, — otrais. Abi ir aizstāvami viena un tā paša dokumentu kopuma lasījumi.
Lētākais modelis strādāja vairāk, lai nonāktu turpat. 28 čaulas komandas, 15 failu nolasījumi, 12 attēlu izgūšanas un 7 grep izsaukumi pret Opus 11, 5, 3 un nevienu — vienubrīd atverot dokumenta pamatā esošo XML, lai tieši nolasītu izvēles rūtiņas stāvokli. To tas varēja atļauties tieši tāpēc, ka ir lēts uz tokenu.
3. Rēķins
Tikai prasību posms vien uz Claude izmaksāja vairāk ($17,39) nekā visa GLM izpilde ($4,82). Šis posms darbojas uz Haiku, Anthropic lētā līmeņa. Lēts līmenis ir lēts tikai blakus savai pašu saimei.
GLM tokenu apetīte nav nekur pazudusi: 2,98 miljoni izvades tokenu un 2,13 miljoni domāšanas tokenu pret Claude 0,85 un 0,10 miljoniem — aptuveni piecas reizes vairāk rakstīšanas, lai nonāktu pie atbildes. Augustā šī apetīte 3,6× cenu atšķirību noēda līdz 17%. Šoreiz atšķirība bija pietiekami liela, lai to uzņemtu.
Opus veica 28 no daudzlīmeņu izpildes 1498 modeļa izsaukumiem. Haiku veica 1251 un paņēma $23 no $36. Līmeņošana ir ierasta prakse, un tieši tāpēc šī izpilde maksāja $36, nevis aptuveni $130, kā tas būtu, visu darot pēc Opus likmēm, taču sistemātisko prasību caurlaidi apkalpo lētākais modelis visā kaudzē. Tā izvēle ir pelnījusi tikpat rūpīgu izvērtējumu kā galvenā modeļa izvēle.
4. Uzticamība
Šeit lētā izpilde par sevi samaksā nepareizajā valūtā. 10h18min pret 2h11min, un gandrīz nekas no šīs starpības nav papildu domāšana — izpilde 14 līdz 78 minūtes ilgos posmos vienkārši stāvēja un gaidīja pakalpojuma sniedzēja jaudu. Tas liecina par to, cik noslogots konkrētā pēcpusdienā ir maršrutēts galapunkts, nevis par kaut ko modeļa svaros, taču speciālists, kas analīzi sāk pirms pusdienām un cer to izlasīt pēc tām, to pamanīs.
GLM joprojām lūzt arī uz JSON. Viens pārklājuma darbinieks nomira uz nenoslēgtas virknes rīka izsaukuma vidū, un vēl vienam izsaukumam bija vajadzīgs atkārtojums, kas izmaksāja vienu nepārbaudītu prasību no kopas. Tas ir tas pats kļūmes veids, kas nogalināja piecas no sešām GLM-5.2 izpildēm, kad mēs to pirmoreiz salīdzinājām maijā. No letāla tas ir kļuvis par vienu izlaistu vienību, un nekur nav pazudis.
Arī Claude izpilde nebija nevainojama: viens iepirkuma daļas darbinieks pārtrauca darbu pēc piecām kļūdām rīku izsaukumos pēc kārtas, un to nācās norakstīt tieši tāpat. Katrai pa vienai izlaistai vienībai, tikai dažādu iemeslu dēļ.
5. Ko mēs no tā secinām
Viena izpilde katram nav mērījums, un godīgais kopsavilkums nav nekāds efektīgais. Divi dzinēji, kurus cenā šķir septiņas reizes, paveica vienu un to pašu darbu salīdzināmā līmenī, nesaskanēja par smaguma pakāpi tā, kā jebkurā gadījumā izšķirtu cilvēks-vērtētājs, un visvairāk atšķīrās ar to, cik ilgi jāgaida un cik bieži kaut kas izkrīt.
Mums dzinējs ir konfigurācijas slēdzis — viena un tā pati plūsma darbojas ar Claude, GPT, Gemini vai GLM, un katrs posms izmanto tieši to dzinēju, ko izvēlējāties, bez klusas aizvietošanas. Ja posms var nemanāmi nokāpt uz lētāku modeli, jūs nevarat zināt, ko jūsu analīze patiesībā redzēja. Tas ir svarīgāk nekā tas, kuru no šiem diviem izvēlaties.
6. Kā mēs skaitījām
Abas izpildes ir atsevišķas produkcijas analīzes vienam un tam pašam piedāvājumam pret vienu un to pašu iepirkumu, ar vienām un tām pašām uzvednēm, rīkiem un dokumentiem. GLM skaitlis ir izmaksas, ko par katru izsaukumu ziņoja OpenRouter, saskaitītas kopā. Claude skaitlis ir aprēķināts no Anthropic publicētajām likmēm, ieskaitot keša nolasīšanas atlaidi un keša ierakstīšanas piemaksu, jo tiešās API atbildes cenu neatgriež. Atradumu skaitos visur ir nodalīti modeļa sagatavotie atradumi no reģistru pārbaudes. Mūsu maija salīdzinājums ar piecām izpildēm katram modelim ir lielākā izlase.
Izmēģiniet pirmo MI analīzi bez maksas.
Avoti
- Claude API cenas (Anthropic). Avots Opus 4.8, Sonnet 4.6 un Haiku 4.5 likmēm par miljonu tokenu, kā arī keša nolasīšanas un ierakstīšanas koeficientiem, kas izmantoti $36,13 aprēķinā.
- Ķīnas atvērto svaru modeļi ir panākuši līderus iepirkumu analīzē (Tendergate, 2026. gada augusts). Mūsu iepriekšējais pilnā GLM-5.3 salīdzinājums ar Claude, avots 3,6× cenrāža atšķirībai, kas kļuva par 17% atšķirību rēķinā.
- Mēs salīdzinājām Claude, GPT un Gemini reālos iepirkumos (Tendergate, 2026. gada maijs). Mūsu četru modeļu salīdzinājums, avots GLM-5.2 bojātā JSON uzticamības kļūmēm.
Mēs veidojam mākslīgo intelektu iepirkumiem, tāpēc būtu mazliet dīvaini to neizmantot arī šeit. Šis raksts tapis kopīgi: mākslīgais intelekts - nenogurstoša lasīšana un pirmie melnraksti, cilvēki - vērtējums, labojumi un gala vārds.