Liigu põhisisu juurde

ProcureBench

LLM-mudelite võrdlus hanketöös

Iga mudelikomplekt paneb samad kolm tootmisagenti tööle ühe koolirenoveerimise hanke kallal inglise ja läti keeles. Tulemusi hinnatakse kindla vastusevõtme järgi. Kulu on kogu tsükli LLM-kasutus.

Uuendatud 11. september 2026. Korpuse versioon 2026-09-1, hindamise versioon 1.

Ühe katsega komplektid on ühe tsükli vaatlused: nende hinnetel, kohtadel, vahedel, kulul ja kestusel puudub dispersiooni hinnang.

Koondhinne

Kolme tegevuse hinnete keskmine, arvutatud inglise ja läti keele keskmisena. Skaala 0 kuni 100. Määratlused on jaotises Meetod.

84.3
83.6
81.6
81.0
80.8
78.7
76.3
Kimi K3
Claude tiered
GLM-5.3-Flash
Muse Spark 1.3
Gemini 3.8 Flash
DeepSeek V4.1 Flash
OpenAI tiered

Koondhinne keelte kaupa

Vahe on inglise keele koondhinne miinus läti keele koondhinne. Negatiivne vahe tähendab, et komplekt sai läti keeles kõrgema hinde.

  • Inglise
  • Läti
Inglise 87.9
Läti 80.6
Inglise 85.2
Läti 82.0
Inglise 84.1
Läti 79.2
Inglise 79.8
Läti 82.2
Inglise 83.8
Läti 77.8
Inglise 81.1
Läti 76.3
Inglise 76.1
Läti 76.5
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast EN − LV +7.3
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast EN − LV +3.2
GLM-5.3-Flash
OpenRouter, all tiers EN − LV +4.9
Muse Spark 1.3
OpenRouter, all tiers EN − LV -2.4
Gemini 3.8 Flash
all tiers EN − LV +6.0
DeepSeek V4.1 Flash
OpenRouter, all tiers EN − LV +4.8
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast EN − LV -0.4

Hinded tegevuste kaupa

Iga tegevust hinnatakse igas keeles skaalal 0 kuni 100.

Komplekt Nõuete tuvastamine Pakkumuste analüüs Turu-uuring
Inglise Läti Inglise Läti Inglise Läti
Kimi K3
92.2 91.5 91.5 93.6 80.0 56.7
Claude tiered
90.2 81.1 95.4 95.0 70.0 70.0
GLM-5.3-Flash
80.3 92.1 95.2 91.2 76.7 54.4
Muse Spark 1.3
90.8 81.6 88.6 95.0 60.0 70.0
Gemini 3.8 Flash
91.4 82.6 100.0 90.9 60.0 60.0
DeepSeek V4.1 Flash
89.7 91.2 87.5 87.6 66.1 50.0
OpenAI tiered
92.2 92.4 82.7 83.6 53.3 53.3

Kulu, aeg ja töökindlus

Kulu on LLM-kasutus mõlemas keeles ja kõigis tegevustes, kaasa arvatud kordused. Kalendriaeg on kogu tsükli kestus. Töökindlus on lõpetatud tegevuskirjete arv jagatud katsete arvuga.

Koht Komplekt Koondhinne Inglise Läti EN − LV Kogukulu Kalendriaeg Töökindlus Katsed
1
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
84.3 87.9 80.6 +7.3 $46.52 5 h 57 min 100% 1
2
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
83.6 85.2 82.0 +3.2 $77.69 7 h 7 min 100% 1
3
GLM-5.3-Flash
OpenRouter, all tiers
81.6 84.1 79.2 +4.9 $4.15 13 h 38 min 89% 1
4
Muse Spark 1.3
OpenRouter, all tiers
81.0 79.8 82.2 -2.4 $39.80 2 h 11 min 100% 1
5
Gemini 3.8 Flash
all tiers
80.8 83.8 77.8 +6.0 $70.54 6 h 7 min 100% 1
6
DeepSeek V4.1 Flash
OpenRouter, all tiers
78.7 81.1 76.3 +4.8 $13.90 3 h 14 min 100% 1
7
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
76.3 76.1 76.5 -0.4 $30.21 2 h 9 min 100% 1

Komplektid, mudelid ja hindajad

Komplekt Põhiroll Keskmine roll Kiire roll Hindaja Tsükli kuupäev
Kimi K3
kimi-k3 kimi-k3 kimi-k3 claude-fable-5-1 2026-09-07
Claude tiered
claude-opus-4-8 claude-sonnet-4-6 claude-haiku-4-5 claude-fable-5-1 2026-09-05
GLM-5.3-Flash
glm-5.3-flash glm-5.3-flash glm-5.3-flash claude-fable-5-1 2026-09-07
Muse Spark 1.3
muse-spark-1.3 muse-spark-1.3 muse-spark-1.3 claude-fable-5-1 2026-09-05
Gemini 3.8 Flash
gemini-3.8-flash gemini-3.8-flash gemini-3.8-flash claude-fable-5-1 2026-09-05
DeepSeek V4.1 Flash
deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash gpt-6 2026-09-11
OpenAI tiered
gpt-5.6-sol gpt-5.6-terra gpt-5.4-mini claude-fable-5-1 2026-09-06

Meetod

Komplekt on mudelite kogum, mis on määratud kolmele agendirollile: põhiroll, keskmine roll ja kiire roll. Iga agendi eri sammud kutsuvad eri rolle. Komplekt võib kasutada üht mudelit kõigis kolmes rollis või eri mudelit igas rollis.

Korpus on üks kohaliku omavalitsuse koolirenoveerimise hange kahe osaga paralleelsetes inglise- ja lätikeelsetes versioonides: hanketingimused, tehniline kirjeldus, tööde mahtude tabel, lepingu projekt, joonis ja kaks pakkumust. Üks pakkumus vastab nõuetele. Teises on 22 teadlikult sisse pandud puudust; osa neist on nähtavad ainult tabelis, osa ainult skaneeritud sertifikaadilehtedel.

Iga komplekti, keele ja katse jaoks teeb võrdlus ühe korra nõuete tuvastamise hanketingimustest, pakkumuse analüüsi kummagi pakkumuse kohta ja ühe korra hanke positsioonide turu-uuringu. Kasutatakse samu töid, liivakaste ja tööriistu nagu tootmises, ühe erandiga: iga kataloogi positsioon kinnitatakse automaatselt, et turu-uuring saaks alata ilma inimese sammuta.

Pakkumuste analüüsi hinnatakse sisse pandud puuduste leidmise (50%), mõlemas pakkumuses valehäirete vältimise täpsuse (30%) ja otsuse õigsuse (20%) alusel; katse hinne on kahe pakkumuse hinnetest madalam. Nõuete tuvastamist hinnatakse etalonnõuete leidmise (60%), täpsuse (20%) ning osade ja kriteeriumide struktuuri (20%) alusel. Turu-uuring on 40% struktuurne (tsükkel lõpetatud, vähemalt ühe hinnapakkumisega positsioonide osakaal, kontrollitud allikaga hinnapakkumiste osakaal) ja 60% faktide loetelu, mis peab ülevaates olema. Kui katseid on rohkem kui üks, on iga tegevuse hinne katsete mediaan. Keele koondhinne on kolme tegevuse hinnete keskmine; üldine koondhinne on inglise ja läti keele koondhinnete keskmine.

Eraldi mudel võrdleb töölehel iga tulemust vastusevõtmega; seejärel rakendab hindamisalgoritm eespool toodud kindlaid kaale. Hindaja ei ole kunagi üks testitavatest mudelitest, kuid võib olla sama tootja mudel. Iga komplekti hindaja on toodud komplektide tabelis.

Kulu on ainult LLM-kasutus. Otsetarnijate päringud hinnastatakse tsükli päeva hinnakirja järgi, kusjuures vahemälu lugemisi, kirjutamisi ja mõtlemistokeneid kaalutakse nii, nagu tarnija neid arveldab. OpenRouteri päringute puhul kasutatakse OpenRouteri teatatud kulu. Kalendriaeg on aeg käivituse algusest lõpuni mõlemas keeles, kaasa arvatud ettevalmistus ja järjekorras ootamine.

Töökindlus on lõpetatud tegevuskirjete arv jagatud katsete arvuga; kordus, mis hiljem õnnestub, loetakse kaheks katseks ja üheks lõpetamiseks. Ühe katsega komplekt on üksik valim.