Mēs palaidām Claude, GPT-5.5 un Gemini uz vieniem un tiem pašiem iepirkumiem. Lūk, ko atklājām.
2026. gada 30. maijs

Mēs palaidām Claude, GPT-5.5 un Gemini uz vieniem un tiem pašiem iepirkumiem. Lūk, ko atklājām.

Modelis, kas darbina MI iepirkumu analīzi, mums ir konfigurācijas slēdzis. To pašu piedāvājuma un nolikuma analīzi var palaist uz Anthropic Claude, OpenAI GPT, Google Gemini — vai, tagad, uz atvērtā koda modeļa, piemēram, Zhipu GLM. Tāpēc uzdevām acīmredzamo jautājumu vēlreiz, šoreiz ar četriem dzinējiem trīs vietā: ja nomainām modeli, kas patiesībā mainās — izmaksās, ātrumā un vērtējuma kvalitātē?

Lai to noskaidrotu, palaidām savu pilno produkcijas analīzes konveijeru — to pašu, kas slēpjas aiz pogas "Palaist analīzi" — pret vienu reālistisku iepirkumu ar diviem piedāvājumiem, atkārtojot to piecas reizes katram modelim, lai atdalītu signālu no trokšņa. Katrs posms darbojas uz izvēlētā modeļa: jomas noteikšana, prasību izvilkšana, vērtēšana pa katru prasību, galvenais spriešanas aģents un verifikācijas posms. Lūk, ko atklājām.

4 / 4
modeļi pareizi noraidīja slikto piedāvājumu un apstiprināja labo — katrā palaišanā
17 pret 13
trūkumi (no 17), ko sliktajā piedāvājumā atrada Claude un GPT salīdzinājumā ar Gemini
≈ 2,4×
izmaksu starpība uz vienu analīzi — un lētākais (uz vienu marķieri) modelis izrādījās visdārgākais palaišanā

Iestatījums

Izveidojām vienu pierādījumiem blīvu iepirkumu ar iepriekš reģistrētu atbilžu atslēgu, lai kvalitāti varētu novērtēt objektīvi, nevis pēc iespaida:

Četri modeļi: Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro un atvērtā koda GLM-5.2. Piecas palaišanas katram modelim katram piedāvājumam; bez pārslēgšanās starp modeļiem — "OpenAI palaišana" ir 100% OpenAI.

Izmaksas: lētākais uz marķieri modelis ir tas dārgais

Tas bija lielākais pārsteigums, un tas apgriež intuīciju otrādi. Gemini ir lētākais modelis uz vienu marķieri ar lielu pārsvaru — un tomēr tas bija visdārgākais reālajā palaišanā. Vienas analīzes mediānas izmaksas (atbilstošais piedāvājums):

Izmaksas uz vienu analīzi (mazāk ir labāk)
Atbilstošais piedāvājums, 5 palaišanu mediāna.
Gemini 3.1 Pro $1,41
Claude Opus 4.8 $0,83
GPT-5.5 $0,68
GLM-5.2 $0,60

Kāpēc? Gemini ir marķieru izsalcis. Vienā palaišanā tas izlaida cauri konveijeram vairākkārt vairāk marķieru nekā Claude vai GPT — atkal un atkal pārlasot dokumentus, kamēr vērtēja katru prasību — un šis apjoms pārmāca tā zemo cenu uz marķieri. Pa abiem piedāvājumiem starpība palielinās: pilns iepirkums (abi piedāvājumi) izmaksāja aptuveni $3,02 uz Gemini, $2,76 uz Claude un $1,62 uz GPT. Atvērtā koda GLM-5.2 — aptuveni $0,94 ievadē / $3,00 izvadē par miljonu marķieru caur OpenRouter — bija lētākais dzinējs no visiem.

Sliktā piedāvājuma noķeršana: rūpīgums šķir lauku

Neatbilstošajā piedāvājumā katrs modelis nonāca pie pareizā lēmuma — "neiesniegt", katru reizi. Krasi atšķīrās tas, cik daudz pierādījumu katrs patiešām izcēla. 17 iestrādāto trūkumu noķeršana:

Sliktajā piedāvājumā noķertie trūkumi (no 17)
Mediāna pa 5 palaišanām katram modelim. Vairāk ir labāk.
Claude Opus 4.8 17 / 17 — katrā palaišanā
GPT-5.5 17 / 17 — katrā palaišanā
GLM-5.2 17 / 17 (viena palaišana — sk. zemāk)
Gemini 3.1 Pro 13 / 17 (diapazons 10–17)

Claude un GPT bija nevainojami detektori — visi 17 trūkumi, visās piecās palaišanās, ieskaitot smalkos. Gemini, marķieru izsalkušākais un dārgākais dzinējs, bija arī vismazāk rūpīgais un vismazāk konsekventais: tipiska palaišana noķēra ap 13 no 17, un pa palaišanām tas svārstījās no 10 līdz 17. Visbiežāk tas palaida garām klusos izlaidumus — trūkstošu pirmkoda deponēšanas klauzulu (noķerta tikai vienā palaišanā no piecām) un pārāk garu ieviešanas grafiku. Iepirkuma speciālists, kas paļaujas uz Gemini, joprojām saņem pareizo "noraidīt", bet ar plānāku, mazāk aizstāvamu pierādījumu kopumu aiz tā.

Labā piedāvājuma apstiprināšana: nav kļūdainu noraidījumu

Atbilstošajā piedāvājumā pareizā atbilde ir to virzīt tālāk, un šeit modeļi ir mierinoši vienprātīgi: katrs no tiem apstiprināja labo piedāvājumu katrā palaišanā, un neviens kļūdaini nenoraidīja pilnībā kvalificētu pretendentu. Piedāvājums izpilda visas divdesmit prasības un iekļauj visus apliecinošos dokumentus, un modeļi to tā arī izlasīja.

Lēmums par atbilstošo piedāvājumu, pa 5 palaišanām
Abi toņi ir "iesniegt" lēmums — neviens nenoraidīja labo pretendentu.
Gemini 3.1 Pro 5 pārliecināti
GLM-5.2 5 pārliecināti
GPT-5.5 3 pārliecināti / 2 ar piezīmēm
Claude Opus 4.8 2 pārliecināti / 3 ar piezīmēm
Pārliecināti iesniegt Iesniegt, ar nelieliem uzlabojumiem

Atšķirība ir raksturā, nevis pareizībā. Gemini un GLM deva labajam piedāvājumam beznosacījumu apstiprinājumu. Claude un GPT biežāk atgrieza "iesniegt, ar nelieliem uzlabojumiem" — atzīmējot pāris patiesas vājās vietas (atsauces projekts diapazona apakšējā galā, grafiks bez rezerves) kā lietas, ko nostiprināt, nevis kā iemeslus noraidīt. Abas uzvedības ir aizstāvamas; piesardzīgākā, iespējams, dod iepirkuma speciālistam vairāk, ar ko strādāt.

Cik daudz katrs modelis vispār ieraudzīja

Viens slānis, ko galvenais lēmums noslēpj: pirms kaut ko vērtēt, katrs modelis izlasa iepirkumu un izvelk strukturētu prasību sarakstu. No tā paša nolikuma tie izveidoja ļoti atšķirīga sīkuma sarakstus — kas nosaka griestus tam, ko vēlāk var pārbaudīt.

No tā paša nolikuma izvilktās prasības
Atsevišķi saraksta ieraksti, ieskaitot apakšpunktus un iesniegšanas norādes.
GPT-5.5 54
Gemini 3.1 Pro 36
Claude Opus 4.8 36
GLM-5.2 32

GPT sadalīja dokumentu vissīkāk, 54 ierakstos; Claude un Gemini apstājās ap 36; GLM pie 32. Vairāk ierakstu automātiski nav labāk — tas var nozīmēt patiesu sīkumu vai lieku sadrumstalotību — bet tas daudz izskaidro par tālāko uzvedību, un tas ir tieši tas, ko atsevišķa palaišana no sākuma līdz beigām nekad neparāda.

Atvērtā koda pretendents: lēts un spējīgs, līdz brīdim, kad nav

GLM-5.2 ir interesantais jaunpienācējs. Vienkāršajā atbilstošajā piedāvājumā tas bija zvaigzne: lētākais no četriem, pareizs katru reizi, un tas pats izvilka savu prasību sarakstu bez grūtībām. Atvērtā koda modeļi acīmredzami ir aizvēruši lielu daļu plaisas.

Bet tas atdūrās pret cietiem griestiem sarežģītajā darbā. Trūkumiem blīvajā piedāvājumā — kur aģentam strukturētā formā jāpieraksta daudz konstatējumu — GLM-5.2 pabeidza tikai vienu palaišanu no sešām. Pārējās piecas nomira analīzes vidū: modelis radīja bojātu JSON (nokritis komats, nenoslēgta virkne), kamēr izvadīja savu garo konstatējumu sarakstu, un palaišana neatkopās. Kad tas pabeidza, tas noķēra visus 17 trūkumus — tātad spriešana ir klāt; nav tā strukturētās izvades uzticamības zem slodzes. Aģentu konveijeram, kas paļaujas uz korektiem rīku izsaukumiem, tā ir starpība starp lietojamu un kaitinošu modeli.

Uzticieties lēmumam — visu pārējo izvēlieties rūpīgi

Katrā derīgā palaišanā visi četri modeļi noraidīja slikto piedāvājumu un apstiprināja labo. Lēmums ir uzticamā daļa. Rūpīgums, izmaksas un — atvērtā koda modeļiem — uzticamība ir tur, kur tie atšķiras un kur izvēle patiešām nozīmē.

Nav viena uzvarētāja — ir kompromiss

Claude Opus 4.8 — visrūpīgākais un konsekventākais: 17/17 trūkumi katrā palaišanā un vismērenākais vērtējums par labo piedāvājumu. Vidū pēc izmaksām, vidū pēc ātruma.

GPT-5.5 — labākais universālis: 17/17 atklāšana, vissīkākā izvilkšana, lētākais no trim modernākajiem modeļiem un ātrs vieglākajā darbā. Tīrs, uzticams noklusējums.

Gemini 3.1 Pro — ātrs smagajā piedāvājumā, bet āķis ir reāls: visdārgākais palaišanā par spīti zemākajai cenai uz marķieri, un vismazāk rūpīgais un konsekventais detektors. Spējīgs dzinējs, bet ne tas, kam uzticēt augstvērtīga iepirkuma vienpersonisku izvērtēšanu.

GLM-5.2 (atvērtā koda) — lētākais un patiešām labs vienkāršos gadījumos, bet tas nespēja uzticami pabeigt sarežģīto, strukturēto analīzi. Daudzsološs liela apjoma pirmajai caurskatei; vēl ne uzticams smagajiem gadījumiem.

Spriešanas modeļi lielā mērā ir saplūduši pie lēmuma. Kur tie joprojām atšķiras — reizēm 2× izmaksās vai četri palaisti garām trūkumi no septiņpadsmit — ir darbā aiz tā.

Ko tas nozīmē, ja izmantojat MI iepirkumiem

Divas mācības. Pirmā: uzticamais slānis tagad ir lēmums abos galos — noraidīt slikto piedāvājumu, apstiprināt labo — bet pierādījumi aiz tā joprojām pietiekami atšķiras, lai cilvēks paliktu pie rekomendācijas. Otrā: modeļa izvēle ir apzināts kompromiss, nevis meklējumi pēc viena universāla labākā. Rūpīgie ir savas cenas vērti, kad palaists garām trūkums maksā dārgi; lētākā uz marķieri opcija var klusi kļūt par dārgo; un atvērtā koda modelis var būt lieliska vērtība tieši līdz brīdim, kad tā izvades uzticamība izsīkst.

Nekas no tā neaizvāc cilvēku, kas paraksta rekomendāciju. Tas asina to, ko viņš dara: MI izlasa katru lapu katrā dokumentā un nekad nenogurst 200. lappusē, bet speciālists pārbauda pierādījumus un patur lēmumu.

Kā mēs to palaidām

  1. Viens sintētisks EUR 12M iepirkums, četras daļas, divdesmit obligātas prasības, ar iepriekš reģistrētu atslēgu no 17 iestrādātiem trūkumiem neatbilstošajā piedāvājumā; atbilstošais piedāvājums iekļauj visus pieminētos pielikumus.
  2. Pilns produkcijas konveijers katrā palaišanā: jomas noteikšana → prasību saraksta izvilkšana → vērtēšana pa katru prasību → galvenais spriešanas aģents → katra kritiskā konstatējuma verifikācija.
  3. Katrs posms (izvilkšana, vērtēšana, galvenais, verifikācija) darbojās uz izvēlētā modeļa — bez pārslēgšanās starp modeļiem.
  4. Piecas palaišanas katram modelim katram piedāvājumam, atspoguļojot mediānas un diapazonus. Atklāšanu un kļūdainos konstatējumus vērtēja neatkarīgs LLM tiesnesis pret iepriekš reģistrēto atslēgu.
  5. Ierobežojumi: viens sintētisks angļu valodas iepirkums vienā jomā; GLM-5.2 pabeidza tikai vienu neatbilstošo palaišanu no sešām (bojāta JSON kļūmes), tāpēc tā atklāšanas rādītājs tur ir viens datu punkts. Viena tehniska piezīme: OpenRouter "presets" ir piesaistīti kontam, kura atslēga tos izsniedz — tas pats preseta nosaukums ar citu atslēgu var maršrutēt uz citu galapunktu.
Uzziniet, kā MI var palīdzēt jūsu iepirkumos.
Izmēģiniet pirmo MI analīzi bez maksas.
Reģistrēties bez maksas
Atpakaļ uz blogu