Pereiti prie pagrindinio turinio

ProcureBench

LLM modelių palyginimas pirkimų darbe

Kiekvienas modelių rinkinys paleidžia tuos pačius tris produkcinius agentus viename mokyklos renovacijos pirkime anglų ir latvių kalbomis. Rezultatai vertinami pagal fiksuotą atsakymų raktą. Kaina yra viso ciklo LLM sunaudojimas.

Atnaujinta 2026 m. rugsėjis 11 d.. Korpuso versija 2026-09-1, vertinimo versija 1.

Rinkiniai su vienu bandymu yra vieno ciklo stebėjimai: jų įverčiai, vietos, skirtumai, kaina ir trukmė neturi dispersijos įverčio.

Bendras įvertis

Trijų veiklų įverčių vidurkis, apskaičiuotas kaip anglų ir latvių kalbų vidurkis. Skalė nuo 0 iki 100. Apibrėžimai pateikti skyriuje Metodas.

84.3
83.6
81.6
81.0
80.8
78.7
76.3
Kimi K3
Claude tiered
GLM-5.3-Flash
Muse Spark 1.3
Gemini 3.8 Flash
DeepSeek V4.1 Flash
OpenAI tiered

Bendras įvertis pagal kalbą

Skirtumas yra anglų kalbos bendras įvertis minus latvių kalbos bendras įvertis. Neigiamas skirtumas reiškia, kad rinkinys latvių kalba surinko daugiau.

  • Anglų
  • Latvių
Anglų 87.9
Latvių 80.6
Anglų 85.2
Latvių 82.0
Anglų 84.1
Latvių 79.2
Anglų 79.8
Latvių 82.2
Anglų 83.8
Latvių 77.8
Anglų 81.1
Latvių 76.3
Anglų 76.1
Latvių 76.5
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast EN − LV +7.3
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast EN − LV +3.2
GLM-5.3-Flash
OpenRouter, all tiers EN − LV +4.9
Muse Spark 1.3
OpenRouter, all tiers EN − LV -2.4
Gemini 3.8 Flash
all tiers EN − LV +6.0
DeepSeek V4.1 Flash
OpenRouter, all tiers EN − LV +4.8
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast EN − LV -0.4

Įverčiai pagal veiklas

Kiekviena veikla vertinama nuo 0 iki 100 kiekviena kalba.

Rinkinys Reikalavimų išgavimas Pasiūlymų analizė Rinkos tyrimas
Anglų Latvių Anglų Latvių Anglų Latvių
Kimi K3
92.2 91.5 91.5 93.6 80.0 56.7
Claude tiered
90.2 81.1 95.4 95.0 70.0 70.0
GLM-5.3-Flash
80.3 92.1 95.2 91.2 76.7 54.4
Muse Spark 1.3
90.8 81.6 88.6 95.0 60.0 70.0
Gemini 3.8 Flash
91.4 82.6 100.0 90.9 60.0 60.0
DeepSeek V4.1 Flash
89.7 91.2 87.5 87.6 66.1 50.0
OpenAI tiered
92.2 92.4 82.7 83.6 53.3 53.3

Kaina, laikas ir patikimumas

Kaina yra LLM sunaudojimas abiem kalbomis ir visose veiklose, įskaitant pakartojimus. Kalendorinis laikas yra viso ciklo trukmė. Patikimumas yra užbaigtų veiklos įrašų skaičius, padalytas iš bandymų skaičiaus.

Vieta Rinkinys Bendras įvertis Anglų Latvių EN − LV Bendra kaina Kalendorinis laikas Patikimumas Bandymai
1
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
84.3 87.9 80.6 +7.3 $46.52 5 h 57 min 100% 1
2
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
83.6 85.2 82.0 +3.2 $77.69 7 h 7 min 100% 1
3
GLM-5.3-Flash
OpenRouter, all tiers
81.6 84.1 79.2 +4.9 $4.15 13 h 38 min 89% 1
4
Muse Spark 1.3
OpenRouter, all tiers
81.0 79.8 82.2 -2.4 $39.80 2 h 11 min 100% 1
5
Gemini 3.8 Flash
all tiers
80.8 83.8 77.8 +6.0 $70.54 6 h 7 min 100% 1
6
DeepSeek V4.1 Flash
OpenRouter, all tiers
78.7 81.1 76.3 +4.8 $13.90 3 h 14 min 100% 1
7
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
76.3 76.1 76.5 -0.4 $30.21 2 h 9 min 100% 1

Rinkiniai, modeliai ir vertintojai

Rinkinys Pagrindinis vaidmuo Vidutinis vaidmuo Greitasis vaidmuo Vertintojas Ciklo data
Kimi K3
kimi-k3 kimi-k3 kimi-k3 claude-fable-5-1 2026-09-07
Claude tiered
claude-opus-4-8 claude-sonnet-4-6 claude-haiku-4-5 claude-fable-5-1 2026-09-05
GLM-5.3-Flash
glm-5.3-flash glm-5.3-flash glm-5.3-flash claude-fable-5-1 2026-09-07
Muse Spark 1.3
muse-spark-1.3 muse-spark-1.3 muse-spark-1.3 claude-fable-5-1 2026-09-05
Gemini 3.8 Flash
gemini-3.8-flash gemini-3.8-flash gemini-3.8-flash claude-fable-5-1 2026-09-05
DeepSeek V4.1 Flash
deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash gpt-6 2026-09-11
OpenAI tiered
gpt-5.6-sol gpt-5.6-terra gpt-5.4-mini claude-fable-5-1 2026-09-06

Metodas

Rinkinys yra modelių aibė, priskirta trims agentų vaidmenims: pagrindiniam, vidutiniam ir greitajam. Skirtingi kiekvieno agento žingsniai kviečia skirtingus vaidmenis. Rinkinys gali naudoti vieną modelį visiems trims vaidmenims arba skirtingą modelį kiekvienam vaidmeniui.

Korpusą sudaro vienas savivaldybės mokyklos renovacijos pirkimas su dviem dalimis lygiagrečiomis anglų ir latvių kalbų versijomis: pirkimo sąlygos, techninė specifikacija, darbų kiekių žiniaraštis, sutarties projektas, brėžinys ir du pasiūlymai. Vienas pasiūlymas atitinka reikalavimus. Kitame yra 22 sąmoningai įdėti trūkumai; kai kurie matomi tik skaičiuoklėje, kai kurie tik skenuotuose sertifikatų puslapiuose.

Kiekvienam rinkiniui, kalbai ir bandymui palyginimas vieną kartą atlieka reikalavimų išgavimą iš pirkimo sąlygų, pasiūlymo analizę kiekvienam iš dviejų pasiūlymų ir vieną kartą pirkimo pozicijų rinkos tyrimą. Naudojami tie patys darbai, izoliuotos aplinkos ir įrankiai kaip produkcijoje su viena išimtimi: kiekviena katalogo pozicija patvirtinama automatiškai, kad rinkos tyrimas galėtų prasidėti be žmogaus įsikišimo.

Pasiūlymų analizė vertinama pagal įdėtų trūkumų radimą (50%), tikslumą klaidingų pavojaus signalų atžvilgiu abiejuose pasiūlymuose (30%) ir išvados teisingumą (20%); bandymo įvertis yra žemesnis iš dviejų pasiūlymų įverčių. Reikalavimų išgavimas vertinamas pagal etaloninių reikalavimų radimą (60%), tikslumą (20%) ir dalių bei kriterijų struktūrą (20%). Rinkos tyrimas yra 40% struktūrinis (ciklas užbaigtas, pozicijų dalis su bent viena kaina, kainų dalis su patikrintu šaltiniu) ir 60% faktų sąrašas, kuris turi būti ataskaitoje. Kai bandymų daugiau nei vienas, kiekvienos veiklos įvertis yra bandymų mediana. Kalbos bendras įvertis yra trijų veiklų įverčių vidurkis; bendrasis įvertis yra anglų ir latvių kalbų bendrų įverčių vidurkis.

Atskiras modelis darbo lape lygina kiekvieną rezultatą su atsakymų raktu; tada vertintojas pritaiko pirmiau nurodytus fiksuotus svorius. Vertintojas niekada nėra vienas iš testuojamų modelių, tačiau gali būti to paties gamintojo. Kiekvieno rinkinio vertintojas nurodytas rinkinių lentelėje.

Kaina yra tik LLM sunaudojimas. Tiesioginių tiekėjų užklausos įkainojamos pagal ciklo dienos kainoraštį, podėlio skaitymus, rašymus ir mąstymo žetonus sveriant taip, kaip juos apmokestina tiekėjas. OpenRouter užklausoms naudojama OpenRouter nurodyta kaina. Kalendorinis laikas yra laikas nuo vykdymo pradžios iki pabaigos abiem kalbomis, įskaitant paruošimą ir laukimą eilėje.

Patikimumas yra užbaigtų veiklos įrašų skaičius, padalytas iš bandymų skaičiaus; pakartojimas, kuris vėliau pavyksta, skaičiuojamas kaip du bandymai ir vienas užbaigimas. Rinkinys su vienu bandymu yra vienas mėginys.