ProcureBench
LLM-Benchmark für Beschaffungsarbeit
ProcureBench lässt jeden Modell-Stack dieselben drei Produktionsagenten auf einer Schulsanierungs-Ausschreibung ausführen, auf Englisch und auf Lettisch. Die Ergebnisse werden anhand eines festen Lösungsschlüssels bewertet. Die Kosten sind der LLM-Verbrauch des gesamten Durchlaufs.
Gesamtwert
Mittelwert der drei Tätigkeitswerte, gemittelt über Englisch und Lettisch. Skala 0 bis 100. Die Definitionen stehen im Abschnitt Methode.
Gesamtwert nach Sprache
Die Differenz ist der englische Gesamtwert minus der lettische Gesamtwert. Eine negative Differenz bedeutet, dass der Stack auf Lettisch besser abgeschnitten hat.
- Englisch
- Lettisch
Werte nach Tätigkeit
Jede Tätigkeit wird je Sprache mit 0 bis 100 bewertet.
| Stack | Anforderungsextraktion | Angebotsanalyse | Marktforschung | |||
|---|---|---|---|---|---|---|
| Englisch | Lettisch | Englisch | Lettisch | Englisch | Lettisch | |
|
Kimi K3
|
92.2 | 91.5 | 91.5 | 93.6 | 80.0 | 56.7 |
|
Claude tiered
|
90.2 | 81.1 | 95.4 | 95.0 | 70.0 | 70.0 |
|
GLM-5.3-Flash
|
80.3 | 92.1 | 95.2 | 91.2 | 76.7 | 54.4 |
|
Muse Spark 1.3
|
90.8 | 81.6 | 88.6 | 95.0 | 60.0 | 70.0 |
|
Gemini 3.8 Flash
|
91.4 | 82.6 | 100.0 | 90.9 | 60.0 | 60.0 |
|
DeepSeek V4.1 Flash
|
89.7 | 91.2 | 87.5 | 87.6 | 66.1 | 50.0 |
|
OpenAI tiered
|
92.2 | 92.4 | 82.7 | 83.6 | 53.3 | 53.3 |
Kosten, Zeit und Zuverlässigkeit
Die Kosten sind der LLM-Verbrauch beider Sprachen und aller Tätigkeiten, einschließlich Wiederholungen. Die Laufzeit ist die Dauer des gesamten Durchlaufs. Die Zuverlässigkeit ist die Zahl der abgeschlossenen Tätigkeitsdatensätze geteilt durch die Zahl der Versuche.
| Rang | Stack | Gesamtwert | Englisch | Lettisch | EN − LV | Gesamtkosten | Laufzeit | Zuverlässigkeit | Versuche |
|---|---|---|---|---|---|---|---|---|---|
| 1 |
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
|
84.3 | 87.9 | 80.6 | +7.3 | $46.52 | 5 h 57 min | 100% | 1 |
| 2 |
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
|
83.6 | 85.2 | 82.0 | +3.2 | $77.69 | 7 h 7 min | 100% | 1 |
| 3 |
GLM-5.3-Flash
OpenRouter, all tiers
|
81.6 | 84.1 | 79.2 | +4.9 | $4.15 | 13 h 38 min | 89% | 1 |
| 4 |
Muse Spark 1.3
OpenRouter, all tiers
|
81.0 | 79.8 | 82.2 | -2.4 | $39.80 | 2 h 11 min | 100% | 1 |
| 5 |
Gemini 3.8 Flash
all tiers
|
80.8 | 83.8 | 77.8 | +6.0 | $70.54 | 6 h 7 min | 100% | 1 |
| 6 |
DeepSeek V4.1 Flash
OpenRouter, all tiers
|
78.7 | 81.1 | 76.3 | +4.8 | $13.90 | 3 h 14 min | 100% | 1 |
| 7 |
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
|
76.3 | 76.1 | 76.5 | -0.4 | $30.21 | 2 h 9 min | 100% | 1 |
Stacks, Modelle und Bewerter
| Stack | Hauptrolle | Mittlere Rolle | Schnelle Rolle | Bewerter | Datum des Durchlaufs |
|---|---|---|---|---|---|
|
Kimi K3
|
kimi-k3 | kimi-k3 | kimi-k3 | claude-fable-5-1 | 2026-09-07 |
|
Claude tiered
|
claude-opus-4-8 | claude-sonnet-4-6 | claude-haiku-4-5 | claude-fable-5-1 | 2026-09-05 |
|
GLM-5.3-Flash
|
glm-5.3-flash | glm-5.3-flash | glm-5.3-flash | claude-fable-5-1 | 2026-09-07 |
|
Muse Spark 1.3
|
muse-spark-1.3 | muse-spark-1.3 | muse-spark-1.3 | claude-fable-5-1 | 2026-09-05 |
|
Gemini 3.8 Flash
|
gemini-3.8-flash | gemini-3.8-flash | gemini-3.8-flash | claude-fable-5-1 | 2026-09-05 |
|
DeepSeek V4.1 Flash
|
deepseek/deepseek-v4.1-flash | deepseek/deepseek-v4.1-flash | deepseek/deepseek-v4.1-flash | gpt-6 | 2026-09-11 |
|
OpenAI tiered
|
gpt-5.6-sol | gpt-5.6-terra | gpt-5.4-mini | claude-fable-5-1 | 2026-09-06 |
Methode
Ein Stack ist die Menge der Modelle, die den drei Agentenrollen zugewiesen sind: Haupt-, mittlere und schnelle Rolle. Verschiedene Schritte jedes Agenten rufen verschiedene Rollen auf. Ein Stack kann ein Modell für alle drei Rollen oder je Rolle ein anderes Modell verwenden.
Der Korpus ist eine kommunale Ausschreibung zur Schulsanierung mit zwei Losen in parallelen englischen und lettischen Fassungen: Vergabeunterlagen, technische Spezifikation, Leistungsverzeichnis, Vertragsentwurf, eine Zeichnung und zwei Angebote. Ein Angebot erfüllt alle Anforderungen. Das andere enthält 22 bewusst eingebaute Mängel; einige sind nur in der Tabelle sichtbar, einige nur auf gescannten Zertifikatsseiten.
Für jeden Stack, jede Sprache und jeden Versuch führt der Benchmark die Anforderungsextraktion aus den Vergabeunterlagen einmal, die Angebotsanalyse einmal je Angebot und die Marktforschung zu den Positionen der Ausschreibung einmal aus. Er verwendet dieselben Jobs, Sandboxes und Werkzeuge wie die Produktion, mit einer Ausnahme: Jede Katalogposition wird automatisch freigegeben, damit die Marktforschung ohne menschlichen Schritt starten kann.
Die Angebotsanalyse wird nach dem Auffinden der eingebauten Mängel (50%), der Genauigkeit gegenüber Fehlalarmen in beiden Angeboten (30%) und der Richtigkeit des Urteils (20%) bewertet; der Versuchswert ist der niedrigere der beiden Angebotswerte. Die Anforderungsextraktion wird nach dem Auffinden der Referenzanforderungen (60%), der Genauigkeit (20%) und der Struktur aus Losen und Kriterien (20%) bewertet. Die Marktforschung ist zu 40% strukturell (Durchlauf abgeschlossen, Anteil der Positionen mit mindestens einem Angebotspreis, Anteil der Angebotspreise mit geprüfter Quelle) und zu 60% eine Liste von Fakten, die der Bericht enthalten muss. Bei mehr als einem Versuch ist jeder Tätigkeitswert der Median über die Versuche. Der Sprachgesamtwert ist der Mittelwert der drei Tätigkeitswerte; der Gesamtwert ist der Mittelwert des englischen und des lettischen Gesamtwerts.
Ein separates Modell liest jedes Ergebnis in einem Arbeitsblatt gegen den Lösungsschlüssel; anschließend wendet der Bewertungsalgorithmus die oben genannten festen Gewichte an. Der Bewerter ist nie eines der getesteten Modelle, kann aber vom selben Anbieter stammen. Der Bewerter jedes Stacks steht in der Stack-Tabelle.
Die Kosten sind ausschließlich der LLM-Verbrauch. Aufrufe bei Erstanbietern werden zum Listenpreis am Tag des Durchlaufs berechnet, wobei Cache-Lesevorgänge, Cache-Schreibvorgänge und Denk-Token so gewichtet werden, wie der Anbieter sie abrechnet. Für OpenRouter-Aufrufe gelten die von OpenRouter gemeldeten Kosten. Die Laufzeit ist die Zeit vom Start bis zum Ende des Durchlaufs für beide Sprachen, einschließlich Vorbereitung und Wartezeit in der Warteschlange.
Die Zuverlässigkeit ist die Zahl der abgeschlossenen Tätigkeitsdatensätze geteilt durch die Zahl der Versuche; eine Wiederholung, die später gelingt, zählt als zwei Versuche und ein Abschluss. Ein Stack mit einem Versuch ist eine einzelne Stichprobe.