Pāriet uz galveno saturu

ProcureBench

LLM modeļu salīdzinājums iepirkumu darbā

ProcureBench katram modeļu komplektam liek izpildīt tos pašus trīs produkcijas aģentus vienā skolas renovācijas iepirkumā angļu un latviešu valodā. Rezultātus vērtē pēc fiksētas atbilžu atslēgas. Izmaksas ir visa cikla LLM patēriņš.

Atjaunināts 2026. gada 11. septembris. Korpusa versija 2026-09-1, vērtēšanas versija 1.

Komplekti ar vienu mēģinājumu ir viena cikla novērojumi: to vērtējumiem, vietām, starpībām, izmaksām un ilgumam nav dispersijas novērtējuma.

Kopvērtējums

Triju aktivitāšu vērtējumu vidējais, aprēķināts kā angļu un latviešu valodu vidējais. Skala no 0 līdz 100. Definīcijas ir sadaļā “Metode”.

84.3
83.6
81.6
81.0
80.8
78.7
76.3
Kimi K3
Claude tiered
GLM-5.3-Flash
Muse Spark 1.3
Gemini 3.8 Flash
DeepSeek V4.1 Flash
OpenAI tiered

Kopvērtējums pa valodām

Starpība ir angļu valodas kopvērtējums mīnus latviešu valodas kopvērtējums. Negatīva starpība nozīmē, ka komplekts latviešu valodā ieguva augstāku vērtējumu.

  • Angļu
  • Latviešu
Angļu 87.9
Latviešu 80.6
Angļu 85.2
Latviešu 82.0
Angļu 84.1
Latviešu 79.2
Angļu 79.8
Latviešu 82.2
Angļu 83.8
Latviešu 77.8
Angļu 81.1
Latviešu 76.3
Angļu 76.1
Latviešu 76.5
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast EN − LV +7.3
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast EN − LV +3.2
GLM-5.3-Flash
OpenRouter, all tiers EN − LV +4.9
Muse Spark 1.3
OpenRouter, all tiers EN − LV -2.4
Gemini 3.8 Flash
all tiers EN − LV +6.0
DeepSeek V4.1 Flash
OpenRouter, all tiers EN − LV +4.8
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast EN − LV -0.4

Vērtējumi pa aktivitātēm

Katru aktivitāti vērtē no 0 līdz 100 katrā valodā.

Komplekts Prasību izguve Piedāvājumu analīze Tirgus izpēte
Angļu Latviešu Angļu Latviešu Angļu Latviešu
Kimi K3
92.2 91.5 91.5 93.6 80.0 56.7
Claude tiered
90.2 81.1 95.4 95.0 70.0 70.0
GLM-5.3-Flash
80.3 92.1 95.2 91.2 76.7 54.4
Muse Spark 1.3
90.8 81.6 88.6 95.0 60.0 70.0
Gemini 3.8 Flash
91.4 82.6 100.0 90.9 60.0 60.0
DeepSeek V4.1 Flash
89.7 91.2 87.5 87.6 66.1 50.0
OpenAI tiered
92.2 92.4 82.7 83.6 53.3 53.3

Izmaksas, laiks un uzticamība

Izmaksas ir LLM patēriņš abās valodās un visās aktivitātēs, ieskaitot atkārtojumus. Izpildes laiks ir visa cikla ilgums. Uzticamība ir pabeigto aktivitāšu ierakstu skaits, dalīts ar mēģinājumu skaitu.

Vieta Komplekts Kopvērtējums Angļu Latviešu EN − LV Kopējās izmaksas Izpildes laiks Uzticamība Mēģinājumi
1
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
84.3 87.9 80.6 +7.3 $46.52 5 h 57 min 100% 1
2
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
83.6 85.2 82.0 +3.2 $77.69 7 h 7 min 100% 1
3
GLM-5.3-Flash
OpenRouter, all tiers
81.6 84.1 79.2 +4.9 $4.15 13 h 38 min 89% 1
4
Muse Spark 1.3
OpenRouter, all tiers
81.0 79.8 82.2 -2.4 $39.80 2 h 11 min 100% 1
5
Gemini 3.8 Flash
all tiers
80.8 83.8 77.8 +6.0 $70.54 6 h 7 min 100% 1
6
DeepSeek V4.1 Flash
OpenRouter, all tiers
78.7 81.1 76.3 +4.8 $13.90 3 h 14 min 100% 1
7
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
76.3 76.1 76.5 -0.4 $30.21 2 h 9 min 100% 1

Komplekti, modeļi un vērtētāji

Komplekts Galvenā loma Vidējā loma Ātrā loma Vērtētājs Cikla datums
Kimi K3
kimi-k3 kimi-k3 kimi-k3 claude-fable-5-1 2026-09-07
Claude tiered
claude-opus-4-8 claude-sonnet-4-6 claude-haiku-4-5 claude-fable-5-1 2026-09-05
GLM-5.3-Flash
glm-5.3-flash glm-5.3-flash glm-5.3-flash claude-fable-5-1 2026-09-07
Muse Spark 1.3
muse-spark-1.3 muse-spark-1.3 muse-spark-1.3 claude-fable-5-1 2026-09-05
Gemini 3.8 Flash
gemini-3.8-flash gemini-3.8-flash gemini-3.8-flash claude-fable-5-1 2026-09-05
DeepSeek V4.1 Flash
deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash gpt-6 2026-09-11
OpenAI tiered
gpt-5.6-sol gpt-5.6-terra gpt-5.4-mini claude-fable-5-1 2026-09-06

Metode

Komplekts ir modeļu kopa, kas piešķirta trim aģentu lomām: galvenajai, vidējai un ātrajai. Dažādi katra aģenta soļi izsauc dažādas lomas. Komplekts var izmantot vienu modeli visās trīs lomās vai katrā lomā citu modeli.

Korpuss ir viens pašvaldības skolas renovācijas iepirkums ar divām daļām paralēlās angļu un latviešu versijās: nolikums, tehniskā specifikācija, darbu apjomi, līguma projekts, rasējums un divi piedāvājumi. Viens piedāvājums atbilst prasībām. Otrajā ir 22 apzināti ielikti trūkumi; daži redzami tikai izklājlapā, daži tikai skenētās sertifikātu lapās.

Salīdzinājums katram komplektam, valodai un mēģinājumam vienreiz veic prasību izguvi no nolikuma, katram no diviem piedāvājumiem — piedāvājuma analīzi, kā arī vienreiz — tirgus izpēti iepirkuma pozīcijām. Tas izmanto tos pašus darbus, smilškastes un rīkus kā produkcijā, ar vienu izņēmumu: katra kataloga pozīcija tiek apstiprināta automātiski, lai tirgus izpēte varētu sākties bez cilvēka iesaistes.

Piedāvājumu analīzi vērtē pēc ielikto trūkumu atrašanas (50%), spējas izvairīties no viltus trauksmēm abos piedāvājumos (30%) un verdikta pareizības (20%); mēģinājuma vērtējums ir zemākais no abu piedāvājumu vērtējumiem. Prasību izguvi vērtē pēc atsauces prasību atrašanas (60%), precizitātes (20%) un daļu un kritēriju struktūras (20%). Tirgus izpētes vērtējumu veido strukturālā daļa (40%: cikls pabeigts, pozīciju daļa ar vismaz vienu cenu piedāvājumu, cenu piedāvājumu daļa ar pārbaudītu avotu) un faktu pārbaude pēc saraksta (60%: fakti, kam jābūt pārskatā). Ja mēģinājumu ir vairāk par vienu, katras aktivitātes vērtējums ir mēģinājumu mediāna. Valodas kopvērtējums ir triju aktivitāšu vērtējumu vidējais; galīgais kopvērtējums ir angļu un latviešu kopvērtējumu vidējais.

Atsevišķs modelis vērtēšanas veidlapā salīdzina katru rezultātu ar atbilžu atslēgu; pēc tam vērtēšanas aprēķins piemēro iepriekš norādītos fiksētos svarus. Vērtētājs nekad nav viens no testējamajiem modeļiem, taču tas var būt no tā paša ražotāja. Katra komplekta vērtētājs ir norādīts komplektu tabulā.

Izmaksas ir tikai LLM patēriņš. Tiešo pakalpojumu sniedzēju izsaukumi tiek vērtēti pēc cenrāža, kas bija spēkā cikla dienā, kešatmiņas lasījumus, rakstījumus un domāšanas tokenus svērot tā, kā tos rēķina pakalpojumu sniedzējs. OpenRouter izsaukumiem tiek izmantotas OpenRouter ziņotās izmaksas. Izpildes laiks ir laiks no cikla sākuma līdz beigām abās valodās, ieskaitot sagatavošanu un gaidīšanu rindā.

Uzticamība ir pabeigto aktivitāšu ierakstu skaits, dalīts ar mēģinājumu skaitu; atkārtojums, kas vēlāk izdodas, tiek ieskaitīts kā divi mēģinājumi un viens pabeigts mēģinājums. Komplekts ar vienu mēģinājumu ir viens paraugs.