Nuo rugsėjo 10 d. iki spalio 8 d. tą patį viešąjį pirkimą analizavome aštuonis kartus: 53 tikrinami reikalavimai, 22 vertinimo kriterijai, kelios vieno tikro pasiūlymo versijos. Pirkimo, perkančiosios organizacijos ir tiekėjo neįvardijame. Pirmuose septyniuose vykdymuose skaitymą punktas po punkto atliko Haiku 4.5, ir šis etapas kaskart kainavo nuo $14,39 iki $16,04. Spalio 8 d., kitą dieną po to, kai Anthropic išleido Haiku 5.5, perjungėme Tendergate į šį modelį. Tas pats etapas tada kainavo $3,96, 75% mažiau — kaip ir žadėjo Anthropic, pristatydama modelį: „maždaug 75% mažiau“ nei Haiku 4.5.
Mūsų pasiūlymų analizė naudoja trijų pakopų modelius. Greitasis skaito punktas po punkto: po vieną nedidelį agentą kiekvienam reikalavimui, kriterijui ir pirkimo daliai, šiame pirkime 76.
1. Sąskaita
Septyni Haiku 4.5 vykdymai skyrėsi ne daugiau kaip $1,65, tad kritimas nėra atsitiktinis. Visa analizė atpigo nuo $36,27 iki maždaug $18, o pagrindinis modelis su $8,64 dabar yra didžiausia jos išlaidų eilutė.
2. Daugiau mąstymo kiekviename žingsnyje
Protingesniems modeliams turėtų pakakti mažiau žingsnių — taip teigė Anthropic, pristatydama Opus 4.5. Reikalavimams prireikė tiek pat žingsnių — modelio iškvietimų — kaip anksčiau, vertinimo kriterijams maždaug perpus mažiau. Kiekviename žingsnyje modelis mąstė gerokai daugiau.
Užklausos taip pat išaugo: 80 000 žetonų, palyginti su 52 000, iš dalies todėl, kad Haiku 5.5 tą patį tekstą suskaičiuoja maždaug 30% daugiau žetonų. Tai svarbu dėl kainos ribos: iki 100 000 žetonų vienoje užklausoje Haiku 5.5 kainuoja dešimtadalį Haiku 4.5 kainos; virš jos visa užklausa kainuoja penkis kartus daugiau. Ribą peržengė 187 iš mūsų 724 iškvietimų: ketvirtadalis iškvietimų, 68% etapo sąskaitos.
3. Griežčiau tam pačiam pasiūlymui
7 ir 8 vykdymai skaitė identišką pasiūlymo versiją:
| Reikalavimo vertinimas | Haiku 4.5, rugsėjo 24 d. | Haiku 5.5, spalio 8 d. |
|---|---|---|
| Atitinka | 49 | 35 |
| Atitinka iš dalies | 0 | 6 |
| Nepavyko patikrinti | 1 | 8 |
| Netaikoma | 3 | 4 |
Visi 14 pokyčių pasislinko nuo „atitinka“. Kai kurie yra geresni radiniai, pavyzdžiui, pateikimo reikalavimas, kurį senesnis vykdymas pripažino įvykdytu, nors pasiūlyme nėra įkėlimo patvirtinimo. Kai kurie per griežti, pavyzdžiui, du pašalinimo pagrindai, kuriuos perkančioji organizacija pati tikrina viešuosiuose registruose, liko nepatikrinti. Vertinimo kriterijų atveju buvo atvirkščiai: trys iš keturių pokyčių dalinį vertinimą pakėlė iki „atitinka“.
Ne viskas čia yra modelio nuopelnas. Tarp vykdymų pridėjome nurodymą, kad įrodymu laikomi tik paties tiekėjo įrašai, radinius tikrinantį modelį pakeitėme iš Sonnet 4.6 į Sonnet 5.5 ir pakeitėme, kaip dokumentai paverčiami tekstu. Didžiąją kainos kritimo dalį lėmė modelio kaina; vertinimų pokyčiai priklauso visam analizės procesui, ir vienas vykdymas jų neatskiria.
4. Ką iš to pasiimame
Laikykite kiekvieno agento užklausą žemiau 100 000 žetonų ir prieš pasitikėdami modelio pakeitimu iš naujo paleiskite savo dokumentus, kaip pataria ir Anthropic Haiku 5.5 užklausų rašymo vadovas.
Prie kiekvieno Tendergate vertinimo pridėta citata ir vieta dokumente, kuria jis remiasi, todėl bet kurį vertinimą, pasikeitusį po modelio pakeitimo, galima tiesiogiai patikrinti pagal šaltinį.
Kaip skaičiavome: aštuonios produkcinės analizės; pagrindinis modelis 1–6 vykdymuose Opus 4.8, 7–8 vykdymuose Opus 5.5. Kainos apskaičiuotos pagal Anthropic paskelbtas kainas, įskaitant didesnį tarifą virš 100 000 žetonų.
Išbandykite pirmąją DI analizę nemokamai.
Šaltiniai
- Pristatome Claude Haiku 5.5 (Anthropic, 2026 m. spalio 7 d.). Išleidimo data ir teiginys apie „maždaug 75% mažesnes“ naudojimo išlaidas.
- Claude API kainos (Anthropic). Haiku 5.5 ir Haiku 4.5 kainos, įskaitant didesnį Haiku 5.5 tarifą virš 100 000 žetonų.
- Perėjimas prie Claude Haiku 5.5 (Anthropic). Su Haiku 5.5 tas pats tekstas sudaro maždaug 30% daugiau žetonų.
- Užklausų rašymas Claude Haiku 5.5 (Anthropic). Patarimas lyginti pastangų nustatymus pagal savo vertinimus.
- Pristatome Claude Haiku 4.5 (Anthropic, 2025 m. spalio 15 d.). Haiku 4.5 kaina $1 ir $5 už milijoną žetonų.
- Pristatome Claude Opus 4.5 (Anthropic, 2025 m. lapkričio 24 d.). Teiginys, kad protingesni modeliai problemas išsprendžia per mažiau žingsnių.
- Pristatome Claude Opus 5.5 (Anthropic, 2026 m. rugsėjo 22 d.). Pagrindinis modelis 7 ir 8 vykdymuose.
- Pristatome Claude Sonnet 5.5 (Anthropic, 2026 m. rugsėjo 28 d.). Modelis, kuris 8 vykdyme tikrino radinius.
- Pristatome Sonnet 4.6 (Anthropic, 2026 m. vasario 17 d.). Modelis, kuris 1–7 vykdymuose tikrino radinius.
Kuriame dirbtinį intelektą viešiesiems pirkimams, tad būtų kiek keista juo nesinaudoti ir čia. Šį įrašą rašėme kartu: dirbtinis intelektas - nenuilstantis skaitymas ir pirmieji juodraščiai, žmonės - vertinimas, pataisymai ir galutinis žodis.