Tą pačią analizę atlikome dukart: vienas pirkimas, vienas pasiūlymas, ta pati eiga, tos pačios užklausos. Pirmajame vykdyme naudojome Claude — Opus 4.8 mąstymui, Sonnet 4.6 patikrai, Haiku 4.5 sąlygoms skaityti po vieną. 2 valandos 11 minučių, $36,13. Antrajame visiems trims darbams per OpenRouter naudojome GLM-5.3 Flash. 10 valandų 18 minučių, $4,82.
Abu parengė analizę, kurią išsiųstume pasiūlymo vadovui, ir abu priėjo prie tos pačios rekomendacijos. Skiria juos ne sprendimo kokybė. Skiria sąskaita ir patikimumas.
1. Ką vykdėme
Viešasis pirkimas su keliomis dalimis ir prieš jį pateiktas visas pasiūlymas: 210 failų, septynženklė sutarties vertė per metus. Pasiūlymas yra išgalvotas — parašėme jį patys ir padarėme jį kiek įmanoma panašesnį į realų pateikimą. Pirkėjo ir sektoriaus neįvardijame.
Abu vykdymai naudojo identišką eigą — indeksavimą, pagrindinį mąstymo agentą, aprėpties etapą, kuris lygiagrečiai tikrina kiekvieną sąlygą, kriterijų ir pirkimo dalį, patikros etapą, kuris kiekvieną radinį iš naujo sutikrina su pirminiu dokumentu, ir kiekvienos pasiūlyme minimos įmonės bei asmens patikrą registruose. Vienintelis skirtumas buvo tas, kuris variklis aptarnavo kurį etapą.
2. Abu vykdymai atliko darbą
Ta pati rekomendacija ir sutarimas dėl vienuolikos iš šešiolikos vertinimo kriterijų. Abu nepriklausomai aptiko paties dalyvio deklaruotą procentą, kuris neišeina perskaičiavus iš to paties pasiūlymo skaičių, ir užsienio kalba pateiktą dokumentą be patvirtinto vertimo. Skiriasi tai, kaip stipriai jie pasvėrė tai, ką rado.
GLM-5.3 Flash dažniau kėlė sunkumo laipsnį. Tris trūkumus jis įvertino kaip kritinius ten, kur Claude vykdymas panašias problemas užregistravo žemesniu laipsniu arba paliko kriterijų spręsti žmogui. Sunkumas yra vertinimo dalykas, ir nė vienas svėrimas nėra akivaizdžiai teisingas — pasiūlymo vadovui, kuris nori, kad kiekvienas formalumas būtų pažymėtas garsiai, geriau tinka pirmasis, o tam, kuris nori trumpo realių kliūčių sąrašo, tinka antrasis. Abu yra pagrįsti tų pačių dokumentų perskaitymai.
Pigesnis modelis dirbo sunkiau, kad pasiektų tą pačią vietą. 28 apvalkalo komandos, 15 failų skaitymų, 12 vaizdų ištraukimų ir 7 grep užklausos prieš Opus 11, 5, 3 ir nė vieną — vienu metu jis atvėrė dokumento XML, kad tiesiogiai perskaitytų žymimojo langelio būseną. Būtent pigumas už žetoną leido jam tai sau leisti.
3. Sąskaita
Vien sąlygų etapas su Claude kainavo daugiau ($17,39) nei visas GLM vykdymas ($4,82). Tas etapas veikia su Haiku, pigiąja Anthropic pakopa. Pigi pakopa yra pigi tik savo pačios šeimos fone.
GLM žetonų apetitas niekur nedingo: 2,98 milijono išvesties žetonų ir 2,13 milijono mąstymo žetonų prieš Claude 0,85 ir 0,10 milijono, maždaug penkis kartus daugiau rašymo atsakymui pasiekti. Rugpjūtį šis apetitas 3,6× kainos skirtumą sugraužė iki 17%. Šįkart skirtumas buvo pakankamai didelis, kad tai sugertų.
Opus atliko 28 iš 1498 pakopinio vykdymo modelio užklausų. Haiku atliko 1251 ir surinko $23 iš $36. Pakopos yra įprasta praktika ir būtent dėl jų tas vykdymas kainavo $36, o ne maždaug $130, jei visur būtų taikytos Opus kainos, tačiau sistemingą kiekvienos sąlygos peržiūrą aptarnauja pigiausias rinkinio modelis. Jo pasirinkimas nusipelno tokio pat atidumo kaip ir antraštinio modelio pasirinkimas.
4. Patikimumas
Būtent čia pigus vykdymas atsiperka ne ta valiuta. 10 val. 18 min. prieš 2 val. 11 min., ir beveik nė dalis šio skirtumo nėra papildomas mąstymas — vykdymas prastovėjo nuo 14 iki 78 minučių trukusiais tarpsniais laukdamas teikėjo pajėgumo. Tai atspindi, kaip apkrautas maršrutizuotas galinis taškas yra tą popietę, o ne ką nors apie pačius svorius, bet specialistas, kuris analizę paleidžia prieš pietus ir tikisi ją perskaityti po jų, tai pastebės.
GLM taip pat vis dar lūžta ties JSON. Vienas aprėpties darbininkas žuvo dėl neuždarytos eilutės įrankio iškvietimo viduryje, o dar viena užklausa pareikalavo pakartojimo, ir dėl to viena rinkinio sąlyga liko nepatikrinta. Tai tas pats gedimo tipas, kuris pražudė penkis iš šešių GLM-5.2 vykdymų, kai pirmą kartą jį matavome gegužę. Iš mirtino jis tapo vienu praleistu punktu, bet niekur nedingo.
Claude vykdymas taip pat nebuvo nepriekaištingas: vienas pirkimo dalies darbininkas nutrūko po penkių iš eilės einančių įrankio klaidų ir buvo nurašytas lygiai taip pat. Po vieną praleistą punktą kiekvienam, dėl skirtingų priežasčių.
5. Ką iš to pasiimame
Po vieną vykdymą kiekvienam nėra matavimas, o sąžininga santrauka nėra įspūdinga. Du varikliai, kurių kaina skiriasi septynis kartus, atliko tą patį darbą panašiu lygiu, nesutarė dėl sunkumo taip, kaip vis tiek spręstų žmogus recenzentas, ir labiausiai skyrėsi tuo, kiek laiko lauksite ir kaip dažnai kas nors iškrenta.
Mums variklis yra konfigūracijos jungtukas — ta pati eiga veikia su Claude, GPT, Gemini ar GLM, ir kiekvienas etapas naudoja jūsų pasirinktą variklį, be tylaus pakeitimo. Jei etapas gali tyliai nusileisti iki pigesnio modelio, negalite žinoti, ką jūsų analizė iš tikrųjų perskaitė. Tai svarbiau nei tai, kurį iš šių dviejų pasirinksite.
6. Kaip skaičiavome
Abu vykdymai yra atskiros produkcinės to paties pasiūlymo analizės prieš tą patį pirkimą, su tomis pačiomis užklausomis, įrankiais ir dokumentais. GLM skaičius yra kaina, kurią už kiekvieną užklausą pateikė OpenRouter, sudėjus visas. Claude skaičius apskaičiuotas pagal Anthropic skelbiamas kainas, įskaitant podėlio skaitymo nuolaidą ir podėlio įrašymo priemoką, nes tiesioginiai atsakymai kainos negrąžina. Radinių skaičiai visur atskiria modelio parengtus radinius nuo registrų patikros. Mūsų gegužės palyginimas, penki vykdymai kiekvienam modeliui, yra didesnė imtis.
Išbandykite pirmąją DI analizę nemokamai.
Šaltiniai
- Claude API kainos (Anthropic). Opus 4.8, Sonnet 4.6 ir Haiku 4.5 kainų už milijoną žetonų šaltinis, taip pat podėlio skaitymo ir podėlio įrašymo koeficientų, naudotų $36,13 sumai apskaičiuoti.
- Kinijos atvirųjų svorių modeliai pasiekė lyderius pirkimų analizėje (Tendergate, 2026 m. rugpjūtis). Ankstesnis mūsų pilnojo GLM-5.3 palyginimas su Claude, 3,6× kainoraščio skirtumo, tapusio 17% sąskaitos skirtumu, šaltinis.
- Palyginome Claude, GPT ir Gemini realiuose pirkimuose (Tendergate, 2026 m. gegužė). Mūsų keturių modelių palyginimas, GLM-5.2 netaisyklingo JSON patikimumo gedimų šaltinis.
Kuriame dirbtinį intelektą viešiesiems pirkimams, tad būtų kiek keista juo nesinaudoti ir čia. Šį įrašą rašėme kartu: dirbtinis intelektas - nenuilstantis skaitymas ir pirmieji juodraščiai, žmonės - vertinimas, pataisymai ir galutinis žodis.