Zum Hauptinhalt springen

ProcureBench

LLM-Benchmark für Beschaffungsarbeit

ProcureBench lässt jeden Modell-Stack dieselben drei Produktionsagenten auf einer Schulsanierungs-Ausschreibung ausführen, auf Englisch und auf Lettisch. Die Ergebnisse werden anhand eines festen Lösungsschlüssels bewertet. Die Kosten sind der LLM-Verbrauch des gesamten Durchlaufs.

Aktualisiert am 11. September 2026. Korpusversion 2026-09-1, Bewertungsversion 1.

Stacks mit einem Versuch sind Einzelbeobachtungen: Für ihre Werte, Ränge, Differenzen, Kosten und Laufzeit gibt es keine Varianzschätzung.

Gesamtwert

Mittelwert der drei Tätigkeitswerte, gemittelt über Englisch und Lettisch. Skala 0 bis 100. Die Definitionen stehen im Abschnitt Methode.

84.3
83.6
81.6
81.0
80.8
78.7
76.3
Kimi K3
Claude tiered
GLM-5.3-Flash
Muse Spark 1.3
Gemini 3.8 Flash
DeepSeek V4.1 Flash
OpenAI tiered

Gesamtwert nach Sprache

Die Differenz ist der englische Gesamtwert minus der lettische Gesamtwert. Eine negative Differenz bedeutet, dass der Stack auf Lettisch besser abgeschnitten hat.

  • Englisch
  • Lettisch
Englisch 87.9
Lettisch 80.6
Englisch 85.2
Lettisch 82.0
Englisch 84.1
Lettisch 79.2
Englisch 79.8
Lettisch 82.2
Englisch 83.8
Lettisch 77.8
Englisch 81.1
Lettisch 76.3
Englisch 76.1
Lettisch 76.5
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast EN − LV +7.3
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast EN − LV +3.2
GLM-5.3-Flash
OpenRouter, all tiers EN − LV +4.9
Muse Spark 1.3
OpenRouter, all tiers EN − LV -2.4
Gemini 3.8 Flash
all tiers EN − LV +6.0
DeepSeek V4.1 Flash
OpenRouter, all tiers EN − LV +4.8
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast EN − LV -0.4

Werte nach Tätigkeit

Jede Tätigkeit wird je Sprache mit 0 bis 100 bewertet.

Stack Anforderungsextraktion Angebotsanalyse Marktforschung
Englisch Lettisch Englisch Lettisch Englisch Lettisch
Kimi K3
92.2 91.5 91.5 93.6 80.0 56.7
Claude tiered
90.2 81.1 95.4 95.0 70.0 70.0
GLM-5.3-Flash
80.3 92.1 95.2 91.2 76.7 54.4
Muse Spark 1.3
90.8 81.6 88.6 95.0 60.0 70.0
Gemini 3.8 Flash
91.4 82.6 100.0 90.9 60.0 60.0
DeepSeek V4.1 Flash
89.7 91.2 87.5 87.6 66.1 50.0
OpenAI tiered
92.2 92.4 82.7 83.6 53.3 53.3

Kosten, Zeit und Zuverlässigkeit

Die Kosten sind der LLM-Verbrauch beider Sprachen und aller Tätigkeiten, einschließlich Wiederholungen. Die Laufzeit ist die Dauer des gesamten Durchlaufs. Die Zuverlässigkeit ist die Zahl der abgeschlossenen Tätigkeitsdatensätze geteilt durch die Zahl der Versuche.

Rang Stack Gesamtwert Englisch Lettisch EN − LV Gesamtkosten Laufzeit Zuverlässigkeit Versuche
1
Kimi K3
OpenRouter, reasoning xhigh main / medium mid / minimal fast
84.3 87.9 80.6 +7.3 $46.52 5 h 57 min 100% 1
2
Claude tiered
Opus 4.8 main, Sonnet 4.6 mid, Haiku 4.5 fast
83.6 85.2 82.0 +3.2 $77.69 7 h 7 min 100% 1
3
GLM-5.3-Flash
OpenRouter, all tiers
81.6 84.1 79.2 +4.9 $4.15 13 h 38 min 89% 1
4
Muse Spark 1.3
OpenRouter, all tiers
81.0 79.8 82.2 -2.4 $39.80 2 h 11 min 100% 1
5
Gemini 3.8 Flash
all tiers
80.8 83.8 77.8 +6.0 $70.54 6 h 7 min 100% 1
6
DeepSeek V4.1 Flash
OpenRouter, all tiers
78.7 81.1 76.3 +4.8 $13.90 3 h 14 min 100% 1
7
OpenAI tiered
GPT-5.6 Sol main, GPT-5.6 Terra mid, GPT-5.4 mini fast
76.3 76.1 76.5 -0.4 $30.21 2 h 9 min 100% 1

Stacks, Modelle und Bewerter

Stack Hauptrolle Mittlere Rolle Schnelle Rolle Bewerter Datum des Durchlaufs
Kimi K3
kimi-k3 kimi-k3 kimi-k3 claude-fable-5-1 2026-09-07
Claude tiered
claude-opus-4-8 claude-sonnet-4-6 claude-haiku-4-5 claude-fable-5-1 2026-09-05
GLM-5.3-Flash
glm-5.3-flash glm-5.3-flash glm-5.3-flash claude-fable-5-1 2026-09-07
Muse Spark 1.3
muse-spark-1.3 muse-spark-1.3 muse-spark-1.3 claude-fable-5-1 2026-09-05
Gemini 3.8 Flash
gemini-3.8-flash gemini-3.8-flash gemini-3.8-flash claude-fable-5-1 2026-09-05
DeepSeek V4.1 Flash
deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash deepseek/deepseek-v4.1-flash gpt-6 2026-09-11
OpenAI tiered
gpt-5.6-sol gpt-5.6-terra gpt-5.4-mini claude-fable-5-1 2026-09-06

Methode

Ein Stack ist die Menge der Modelle, die den drei Agentenrollen zugewiesen sind: Haupt-, mittlere und schnelle Rolle. Verschiedene Schritte jedes Agenten rufen verschiedene Rollen auf. Ein Stack kann ein Modell für alle drei Rollen oder je Rolle ein anderes Modell verwenden.

Der Korpus ist eine kommunale Ausschreibung zur Schulsanierung mit zwei Losen in parallelen englischen und lettischen Fassungen: Vergabeunterlagen, technische Spezifikation, Leistungsverzeichnis, Vertragsentwurf, eine Zeichnung und zwei Angebote. Ein Angebot erfüllt alle Anforderungen. Das andere enthält 22 bewusst eingebaute Mängel; einige sind nur in der Tabelle sichtbar, einige nur auf gescannten Zertifikatsseiten.

Für jeden Stack, jede Sprache und jeden Versuch führt der Benchmark die Anforderungsextraktion aus den Vergabeunterlagen einmal, die Angebotsanalyse einmal je Angebot und die Marktforschung zu den Positionen der Ausschreibung einmal aus. Er verwendet dieselben Jobs, Sandboxes und Werkzeuge wie die Produktion, mit einer Ausnahme: Jede Katalogposition wird automatisch freigegeben, damit die Marktforschung ohne menschlichen Schritt starten kann.

Die Angebotsanalyse wird nach dem Auffinden der eingebauten Mängel (50%), der Genauigkeit gegenüber Fehlalarmen in beiden Angeboten (30%) und der Richtigkeit des Urteils (20%) bewertet; der Versuchswert ist der niedrigere der beiden Angebotswerte. Die Anforderungsextraktion wird nach dem Auffinden der Referenzanforderungen (60%), der Genauigkeit (20%) und der Struktur aus Losen und Kriterien (20%) bewertet. Die Marktforschung ist zu 40% strukturell (Durchlauf abgeschlossen, Anteil der Positionen mit mindestens einem Angebotspreis, Anteil der Angebotspreise mit geprüfter Quelle) und zu 60% eine Liste von Fakten, die der Bericht enthalten muss. Bei mehr als einem Versuch ist jeder Tätigkeitswert der Median über die Versuche. Der Sprachgesamtwert ist der Mittelwert der drei Tätigkeitswerte; der Gesamtwert ist der Mittelwert des englischen und des lettischen Gesamtwerts.

Ein separates Modell liest jedes Ergebnis in einem Arbeitsblatt gegen den Lösungsschlüssel; anschließend wendet der Bewertungsalgorithmus die oben genannten festen Gewichte an. Der Bewerter ist nie eines der getesteten Modelle, kann aber vom selben Anbieter stammen. Der Bewerter jedes Stacks steht in der Stack-Tabelle.

Die Kosten sind ausschließlich der LLM-Verbrauch. Aufrufe bei Erstanbietern werden zum Listenpreis am Tag des Durchlaufs berechnet, wobei Cache-Lesevorgänge, Cache-Schreibvorgänge und Denk-Token so gewichtet werden, wie der Anbieter sie abrechnet. Für OpenRouter-Aufrufe gelten die von OpenRouter gemeldeten Kosten. Die Laufzeit ist die Zeit vom Start bis zum Ende des Durchlaufs für beide Sprachen, einschließlich Vorbereitung und Wartezeit in der Warteschlange.

Die Zuverlässigkeit ist die Zahl der abgeschlossenen Tätigkeitsdatensätze geteilt durch die Zahl der Versuche; eine Wiederholung, die später gelingt, zählt als zwei Versuche und ein Abschluss. Ein Stack mit einem Versuch ist eine einzelne Stichprobe.