No 10. septembra līdz 8. oktobrim mēs astoņas reizes analizējām vienu un to pašu publisko iepirkumu: 53 pārbaudāmas prasības, 22 vērtēšanas kritēriji, vairākas viena reāla piedāvājuma versijas. Iepirkums, pasūtītājs un pretendents paliek nenosaukti. Pirmajās septiņās izpildēs lasīšanu pa punktam veica Haiku 4.5, un šis posms katru reizi izmaksāja $14,39 līdz $16,04. 8. oktobrī, dienu pēc tam, kad Anthropic izlaida Haiku 5.5, mēs pārslēdzām Tendergate uz šo modeli. Tas pats posms tad izmaksāja $3,96, par 75% mazāk — tieši kā Anthropic solīja, laižot klajā modeli: „aptuveni par 75% mazāk“ nekā Haiku 4.5.
Mūsu piedāvājumu analīze izmanto trīs līmeņu modeļus. Ātrākais lasa pa punktam: viens neliels aģents katrai prasībai, kritērijam un daļai, šajā iepirkumā 76.
1. Rēķins
Septiņas Haiku 4.5 izpildes atšķīrās ne vairāk kā par $1,65, tātad kritums nav nejaušība. Visa analīze kļuva lētāka no $36,27 līdz aptuveni $18, un galvenais modelis ar $8,64 tagad ir tās lielākā izmaksu pozīcija.
2. Vairāk domāšanas katrā solī
Gudrākiem modeļiem vajadzētu iztikt ar mazāk soļiem — to Anthropic teica, laižot klajā Opus 4.5. Prasībām vajadzēja tikpat soļu — modeļa izsaukumu — cik iepriekš, vērtēšanas kritērijiem aptuveni uz pusi mazāk. Katrā solī modelis domāja daudz vairāk.
Arī uzvednes kļuva lielākas: 80 000 tokenu pret 52 000, daļēji tāpēc, ka Haiku 5.5 to pašu tekstu saskaita kā aptuveni par 30% vairāk tokenu. Tam ir nozīme cenas robežas dēļ: līdz 100 000 tokenu vienā pieprasījumā Haiku 5.5 maksā desmito daļu no Haiku 4.5 cenas; virs tās viss pieprasījums maksā piecreiz vairāk. Šo robežu pārsniedza 187 no mūsu 724 izsaukumiem: ceturtā daļa izsaukumu, 68% no posma rēķina.
3. Stingrāk tam pašam piedāvājumam
7. un 8. izpilde lasīja identisku piedāvājuma versiju:
| Prasības vērtējums | Haiku 4.5, 24. septembris | Haiku 5.5, 8. oktobris |
|---|---|---|
| Atbilst | 49 | 35 |
| Atbilst daļēji | 0 | 6 |
| Nevarēja pārbaudīt | 1 | 8 |
| Nav piemērojama | 3 | 4 |
Visas 14 izmaiņas virzījās prom no „atbilst“. Dažas ir labāki atklājumi, piemēram, iesniegšanas prasība, ko vecākā izpilde atzina par izpildītu, lai gan piedāvājumā nav augšupielādes apliecinājuma. Dažas ir pārāk stingras, piemēram, divi izslēgšanas iemesli, ko pasūtītājs pats pārbauda publiskos reģistros, palika nepārbaudīti. Vērtēšanas kritērijos bija otrādi: trīs no četrām izmaiņām daļēju vērtējumu paaugstināja līdz „atbilst“.
Ne viss te ir modeļa nopelns. Starp izpildēm mēs pievienojām norādījumu, ka par pierādījumu skaitās tikai pretendenta paša ieraksti, nomainījām konstatējumus pārbaudošo modeli no Sonnet 4.6 uz Sonnet 5.5 un mainījām to, kā dokumenti tiek pārvērsti tekstā. Lielākā daļa izmaksu krituma ir modeļa cena; vērtējumu izmaiņas pieder visam analīzes procesam, un viena izpilde tās nevar nodalīt.
4. Ko mēs no tā secinām
Turiet katra aģenta uzvedni zem 100 000 tokenu un, pirms uzticaties modeļa nomaiņai, palaidiet no jauna savus dokumentus, kā iesaka arī Anthropic Haiku 5.5 uzvedņu ceļvedis.
Katram Tendergate vērtējumam ir pievienots citāts un vieta dokumentā, uz ko tas balstās, tāpēc jebkuru vērtējumu, kas mainās pēc modeļa nomaiņas, var tieši pārbaudīt pret avotu.
Kā mēs skaitījām: astoņas produkcijas analīzes; galvenais modelis 1.–6. izpildē Opus 4.8, 7.–8. izpildē Opus 5.5. Izmaksas aprēķinātas pēc Anthropic publicētajām cenām, ieskaitot augstāko likmi virs 100 000 tokenu.
Izmēģiniet pirmo MI analīzi bez maksas.
Avoti
- Iepazīstinām ar Claude Haiku 5.5 (Anthropic, 2026. gada 7. oktobris). Izlaišanas datums un apgalvojums par „aptuveni 75% mazākām“ darbināšanas izmaksām.
- Claude API cenas (Anthropic). Haiku 5.5 un Haiku 4.5 cenas, tostarp Haiku 5.5 augstākā likme virs 100 000 tokenu.
- Pāreja uz Claude Haiku 5.5 (Anthropic). Tas pats teksts ar Haiku 5.5 veido aptuveni par 30% vairāk tokenu.
- Uzvednes Claude Haiku 5.5 (Anthropic). Ieteikums salīdzināt piepūles iestatījumus ar saviem novērtējumiem.
- Iepazīstinām ar Claude Haiku 4.5 (Anthropic, 2025. gada 15. oktobris). Haiku 4.5 cena $1 un $5 par miljonu tokenu.
- Iepazīstinām ar Claude Opus 4.5 (Anthropic, 2025. gada 24. novembris). Apgalvojums, ka gudrāki modeļi problēmas atrisina mazākā soļu skaitā.
- Iepazīstinām ar Claude Opus 5.5 (Anthropic, 2026. gada 22. septembris). Galvenais modelis 7. un 8. izpildē.
- Iepazīstinām ar Claude Sonnet 5.5 (Anthropic, 2026. gada 28. septembris). Modelis, kas 8. izpildē pārbaudīja konstatējumus.
- Iepazīstinām ar Sonnet 4.6 (Anthropic, 2026. gada 17. februāris). Modelis, kas 1.–7. izpildē pārbaudīja konstatējumus.
Mēs veidojam mākslīgo intelektu iepirkumiem, tāpēc būtu mazliet dīvaini to neizmantot arī šeit. Šis raksts tapis kopīgi: mākslīgais intelekts - nenogurstoša lasīšana un pirmie melnraksti, cilvēki - vērtējums, labojumi un gala vārds.