ProcureBench
LLM modeļu salīdzinājums iepirkumu darbā
ProcureBench katram modeļu komplektam liek izpildīt tos pašus trīs produkcijas aģentus vienā skolas renovācijas iepirkumā angļu un latviešu valodā. Rezultātus vērtē pēc fiksētas atbilžu atslēgas. Izmaksas ir visa cikla LLM patēriņš.
Kopvērtējums
Triju aktivitāšu vērtējumu vidējais, aprēķināts kā angļu un latviešu valodu vidējais. Skala no 0 līdz 100. Definīcijas ir sadaļā “Metode”.
Kopvērtējums pa valodām
Starpība ir angļu valodas kopvērtējums mīnus latviešu valodas kopvērtējums. Negatīva starpība nozīmē, ka komplekts latviešu valodā ieguva augstāku vērtējumu.
- Angļu
- Latviešu
Vērtējumi pa aktivitātēm
Katru aktivitāti vērtē no 0 līdz 100 katrā valodā.
| Komplekts | Prasību izguve | Piedāvājumu analīze | Tirgus izpēte | |||
|---|---|---|---|---|---|---|
| Angļu | Latviešu | Angļu | Latviešu | Angļu | Latviešu | |
|
Kimi K3
|
92.2 | 91.5 | 91.5 | 93.6 | 80.0 | 56.7 |
|
Claude tiered
|
90.2 | 81.1 | 95.4 | 95.0 | 70.0 | 70.0 |
|
GLM-5.3-Flash
|
80.3 | 92.1 | 95.2 | 91.2 | 76.7 | 54.4 |
|
Muse Spark 1.3
|
90.8 | 81.6 | 88.6 | 95.0 | 60.0 | 70.0 |
|
Gemini 3.8 Flash
|
91.4 | 82.6 | 100.0 | 90.9 | 60.0 | 60.0 |
|
DeepSeek V4.1 Flash
|
89.7 | 91.2 | 87.5 | 87.6 | 66.1 | 50.0 |
|
OpenAI tiered
|
92.2 | 92.4 | 82.7 | 83.6 | 53.3 | 53.3 |
Izmaksas, laiks un uzticamība
Izmaksas ir LLM patēriņš abās valodās un visās aktivitātēs, ieskaitot atkārtojumus. Izpildes laiks ir visa cikla ilgums. Uzticamība ir pabeigto aktivitāšu ierakstu skaits, dalīts ar mēģinājumu skaitu.
| Vieta | Komplekts | Kopvērtējums | Angļu | Latviešu | EN − LV | Kopējās izmaksas | Izpildes laiks | Uzticamība | Mēģinājumi |
|---|---|---|---|---|---|---|---|---|---|
| 1 |
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
|
84.3 | 87.9 | 80.6 | +7.3 | $46.52 | 5 h 57 min | 100% | 1 |
| 2 |
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
|
83.6 | 85.2 | 82.0 | +3.2 | $77.69 | 7 h 7 min | 100% | 1 |
| 3 |
GLM-5.3-Flash
OpenRouter, all tiers
|
81.6 | 84.1 | 79.2 | +4.9 | $4.15 | 13 h 38 min | 89% | 1 |
| 4 |
Muse Spark 1.3
OpenRouter, all tiers
|
81.0 | 79.8 | 82.2 | -2.4 | $39.80 | 2 h 11 min | 100% | 1 |
| 5 |
Gemini 3.8 Flash
all tiers
|
80.8 | 83.8 | 77.8 | +6.0 | $70.54 | 6 h 7 min | 100% | 1 |
| 6 |
DeepSeek V4.1 Flash
OpenRouter, all tiers
|
78.7 | 81.1 | 76.3 | +4.8 | $13.90 | 3 h 14 min | 100% | 1 |
| 7 |
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
|
76.3 | 76.1 | 76.5 | -0.4 | $30.21 | 2 h 9 min | 100% | 1 |
Komplekti, modeļi un vērtētāji
| Komplekts | Galvenā loma | Vidējā loma | Ātrā loma | Vērtētājs | Cikla datums |
|---|---|---|---|---|---|
|
Kimi K3
|
kimi-k3 | kimi-k3 | kimi-k3 | claude-fable-5-1 | 2026-09-07 |
|
Claude tiered
|
claude-opus-4-8 | claude-sonnet-4-6 | claude-haiku-4-5 | claude-fable-5-1 | 2026-09-05 |
|
GLM-5.3-Flash
|
glm-5.3-flash | glm-5.3-flash | glm-5.3-flash | claude-fable-5-1 | 2026-09-07 |
|
Muse Spark 1.3
|
muse-spark-1.3 | muse-spark-1.3 | muse-spark-1.3 | claude-fable-5-1 | 2026-09-05 |
|
Gemini 3.8 Flash
|
gemini-3.8-flash | gemini-3.8-flash | gemini-3.8-flash | claude-fable-5-1 | 2026-09-05 |
|
DeepSeek V4.1 Flash
|
deepseek/deepseek-v4.1-flash | deepseek/deepseek-v4.1-flash | deepseek/deepseek-v4.1-flash | gpt-6 | 2026-09-11 |
|
OpenAI tiered
|
gpt-5.6-sol | gpt-5.6-terra | gpt-5.4-mini | claude-fable-5-1 | 2026-09-06 |
Metode
Komplekts ir modeļu kopa, kas piešķirta trim aģentu lomām: galvenajai, vidējai un ātrajai. Dažādi katra aģenta soļi izsauc dažādas lomas. Komplekts var izmantot vienu modeli visās trīs lomās vai katrā lomā citu modeli.
Korpuss ir viens pašvaldības skolas renovācijas iepirkums ar divām daļām paralēlās angļu un latviešu versijās: nolikums, tehniskā specifikācija, darbu apjomi, līguma projekts, rasējums un divi piedāvājumi. Viens piedāvājums atbilst prasībām. Otrajā ir 22 apzināti ielikti trūkumi; daži redzami tikai izklājlapā, daži tikai skenētās sertifikātu lapās.
Salīdzinājums katram komplektam, valodai un mēģinājumam vienreiz veic prasību izguvi no nolikuma, katram no diviem piedāvājumiem — piedāvājuma analīzi, kā arī vienreiz — tirgus izpēti iepirkuma pozīcijām. Tas izmanto tos pašus darbus, smilškastes un rīkus kā produkcijā, ar vienu izņēmumu: katra kataloga pozīcija tiek apstiprināta automātiski, lai tirgus izpēte varētu sākties bez cilvēka iesaistes.
Piedāvājumu analīzi vērtē pēc ielikto trūkumu atrašanas (50%), spējas izvairīties no viltus trauksmēm abos piedāvājumos (30%) un verdikta pareizības (20%); mēģinājuma vērtējums ir zemākais no abu piedāvājumu vērtējumiem. Prasību izguvi vērtē pēc atsauces prasību atrašanas (60%), precizitātes (20%) un daļu un kritēriju struktūras (20%). Tirgus izpētes vērtējumu veido strukturālā daļa (40%: cikls pabeigts, pozīciju daļa ar vismaz vienu cenu piedāvājumu, cenu piedāvājumu daļa ar pārbaudītu avotu) un faktu pārbaude pēc saraksta (60%: fakti, kam jābūt pārskatā). Ja mēģinājumu ir vairāk par vienu, katras aktivitātes vērtējums ir mēģinājumu mediāna. Valodas kopvērtējums ir triju aktivitāšu vērtējumu vidējais; galīgais kopvērtējums ir angļu un latviešu kopvērtējumu vidējais.
Atsevišķs modelis vērtēšanas veidlapā salīdzina katru rezultātu ar atbilžu atslēgu; pēc tam vērtēšanas aprēķins piemēro iepriekš norādītos fiksētos svarus. Vērtētājs nekad nav viens no testējamajiem modeļiem, taču tas var būt no tā paša ražotāja. Katra komplekta vērtētājs ir norādīts komplektu tabulā.
Izmaksas ir tikai LLM patēriņš. Tiešo pakalpojumu sniedzēju izsaukumi tiek vērtēti pēc cenrāža, kas bija spēkā cikla dienā, kešatmiņas lasījumus, rakstījumus un domāšanas tokenus svērot tā, kā tos rēķina pakalpojumu sniedzējs. OpenRouter izsaukumiem tiek izmantotas OpenRouter ziņotās izmaksas. Izpildes laiks ir laiks no cikla sākuma līdz beigām abās valodās, ieskaitot sagatavošanu un gaidīšanu rindā.
Uzticamība ir pabeigto aktivitāšu ierakstu skaits, dalīts ar mēģinājumu skaitu; atkārtojums, kas vēlāk izdodas, tiek ieskaitīts kā divi mēģinājumi un viens pabeigts mēģinājums. Komplekts ar vienu mēģinājumu ir viens paraugs.