10. septembrist 8. oktoobrini analüüsisime sama riigihanget kaheksa korda: 53 kontrollitavat nõuet, 22 hindamiskriteeriumi, ühe päris pakkumuse mitu versiooni. Hanget, hankijat ega pakkujat me ei nimeta. Esimeses seitsmes käivituses tegi punkt-punktilt lugemise Haiku 4.5 ja see etapp maksis iga kord $14,39 kuni $16,04. 8. oktoobril, päev pärast seda, kui Anthropic avaldas Haiku 5.5, viisime Tendergate'i sellele üle. Sama etapp maksis seejärel $3,96, 75% vähem — kooskõlas Anthropicu väljalaskeväitega, et kasutamine maksab „umbes 75% vähem“ kui Haiku 4.5.
Meie pakkumuste analüüs kasutab kolme astme mudeleid. Kiire mudel loeb punkt-punktilt: üks väike agent iga nõude, kriteeriumi ja osa kohta, selles hankes 76.
1. Arve
Seitse Haiku 4.5 käivitust erinesid üksteisest kuni $1,65, nii et langus ei ole juhus. Kogu analüüs odavnes $36,27-lt umbes $18-le ning põhimudel on $8,64-ga nüüd selle suurim kulu.
2. Rohkem mõtlemist igas sammus
Targemad mudelid peaksid hakkama saama vähemate sammudega — nii ütles Anthropic Opus 4.5 avaldamisel. Nõuded vajasid sama palju samme — mudelipäringuid — kui varem, hindamiskriteeriumid umbes poole vähem. Igas sammus mõtles mudel palju rohkem.
Ka päringud kasvasid: 80 000 tokenit 52 000 asemel, osaliselt seetõttu, et Haiku 5.5 loeb sama teksti umbes 30% rohkemateks tokeniteks. See on oluline hinnapiiri tõttu: kuni 100 000 tokeni suuruse päringu puhul maksab Haiku 5.5 kümnendiku Haiku 4.5 hinnast; sellest suurema puhul maksab kogu päring viis korda rohkem. Meie 724 päringust ületas piiri 187: veerand päringutest, 68% etapi arvest.
3. Rangem sama pakkumuse puhul
Käivitused 7 ja 8 lugesid identset pakkumuse versiooni:
| Nõude hinnang | Haiku 4.5, 24. september | Haiku 5.5, 8. oktoober |
|---|---|---|
| Vastab | 49 | 35 |
| Vastab osaliselt | 0 | 6 |
| Ei õnnestunud kontrollida | 1 | 8 |
| Ei kohaldu | 3 | 4 |
Kõik 14 muutust liikusid hinnangust „vastab“ eemale. Mõned on paremad leiud, näiteks esitamisnõue, mille vanem käivitus luges täidetuks, kuigi pakkumuses pole üleslaadimise kinnitust. Mõned on liiga ranged, näiteks kaks kõrvaldamise alust, mida hankija ise avalikest registritest kontrollib ja mis jäid kontrollimata. Hindamiskriteeriumide puhul oli vastupidi: kolm muutust neljast tõstsid osalise hinnangu tasemele „vastab“.
Kõik see ei ole mudeli teene. Käivituste vahel lisasime juhise, et tõendiks loevad ainult pakkuja enda kanded, vahetasime leide üle kontrolliva mudeli Sonnet 4.6-lt Sonnet 5.5-le ja muutsime seda, kuidas dokumendid tekstiks teisendatakse. Suurem osa kulu langusest tuleb mudeli hinnast; hinnangute muutused kuuluvad kogu analüüsiprotsessile ja üks käivitus ei suuda neid eristada.
4. Mida me sellest järeldame
Hoidke iga agendi päring alla 100 000 tokeni ja enne mudelivahetuse usaldamist käivitage oma dokumendid uuesti, nagu soovitab ka Anthropicu Haiku 5.5 viipade juhend.
Iga Tendergate'i hinnangu juures on tsitaat ja asukoht dokumendis, millele see toetub, nii et iga hinnangut, mis pärast mudelivahetust muutub, saab otse allika vastu kontrollida.
Kuidas me lugesime: kaheksa tootmisanalüüsi; põhimudel käivitustes 1–6 Opus 4.8, käivitustes 7–8 Opus 5.5. Kulud põhinevad Anthropicu avaldatud hindadel, sealhulgas kõrgemal hinnal üle 100 000 tokeni.
Proovige esimest AI-analüüsi tasuta.
Allikad
- Introducing Claude Haiku 5.5 (Anthropic, 7. oktoober 2026). Avaldamise kuupäev ja väide, et kasutamine maksab „umbes 75% vähem“.
- Claude API hinnad (Anthropic). Haiku 5.5 ja Haiku 4.5 hinnad, sealhulgas Haiku 5.5 kõrgem hind üle 100 000 tokeni.
- Üleminek Claude Haiku 5.5-le (Anthropic). Sama tekst annab Haiku 5.5-ga umbes 30% rohkem tokeneid.
- Claude Haiku 5.5 viibad (Anthropic). Soovitus võrrelda pingutuse seadistusi oma hindamiste põhjal.
- Introducing Claude Haiku 4.5 (Anthropic, 15. oktoober 2025). Haiku 4.5 hind $1 ja $5 miljoni tokeni kohta.
- Introducing Claude Opus 4.5 (Anthropic, 24. november 2025). Väide, et targemad mudelid lahendavad ülesandeid vähemate sammudega.
- Introducing Claude Opus 5.5 (Anthropic, 22. september 2026). Põhimudel käivitustes 7 ja 8.
- Introducing Claude Sonnet 5.5 (Anthropic, 28. september 2026). Mudel, mis kontrollis käivituses 8 leide üle.
- Introducing Sonnet 4.6 (Anthropic, 17. veebruar 2026). Mudel, mis kontrollis käivitustes 1–7 leide üle.
Me ehitame hangete jaoks tehisintellekti, seega oleks veidi imelik seda siin mitte kasutada. See postitus valmis koostöös: tehisintellekt luges väsimatult ja kirjutas esimesed mustandid, inimesed andsid hinnangu, tegid parandused ja ütlesid lõpliku jah-sõna.