Pāriet uz galveno saturu
Pārslēdzām Tendergate uz Haiku 5.5: lasīšanas rēķins samazinājās par 75%, un vērtējumi tam pašam piedāvājumam kļuva stingrāki
2026. gada 8. oktobris

Pārslēdzām Tendergate uz Haiku 5.5: lasīšanas rēķins samazinājās par 75%, un vērtējumi tam pašam piedāvājumam kļuva stingrāki

No 10. septembra līdz 8. oktobrim mēs astoņas reizes analizējām vienu un to pašu publisko iepirkumu: 53 pārbaudāmas prasības, 22 vērtēšanas kritēriji, vairākas viena reāla piedāvājuma versijas. Iepirkums, pasūtītājs un pretendents paliek nenosaukti. Pirmajās septiņās izpildēs lasīšanu pa punktam veica Haiku 4.5, un šis posms katru reizi izmaksāja $14,39 līdz $16,04. 8. oktobrī, dienu pēc tam, kad Anthropic izlaida Haiku 5.5, mēs pārslēdzām Tendergate uz šo modeli. Tas pats posms tad izmaksāja $3,96, par 75% mazāk — tieši kā Anthropic solīja, laižot klajā modeli: „aptuveni par 75% mazāk“ nekā Haiku 4.5.

−75%
lasīšanas posma izmaksas tam pašam piedāvājumam, no $16,04 līdz $3,96
17 min
lasīšanas posma ilgums, salīdzinot ar 24–38 minūtēm ar Haiku 4.5
14 / 53
prasības, kurām identiskam piedāvājumam mainījās vērtējums

Mūsu piedāvājumu analīze izmanto trīs līmeņu modeļus. Ātrākais lasa pa punktam: viens neliels aģents katrai prasībai, kritērijam un daļai, šajā iepirkumā 76.

1. Rēķins

Lasīšanas posma izmaksas vienai analīzei, tas pats iepirkums
1.–7. izpilde ar Haiku 4.5 (10.–24. septembris), 8. izpilde ar Haiku 5.5 (8. oktobris).
1. izpilde · 4.5 $14,39
2. izpilde · 4.5 $14,67
3. izpilde · 4.5 $16,01
4. izpilde · 4.5 $15,22
5. izpilde · 4.5 $15,43
6. izpilde · 4.5 $15,06
7. izpilde · 4.5 $16,04
8. izpilde · 5.5 $3,96

Septiņas Haiku 4.5 izpildes atšķīrās ne vairāk kā par $1,65, tātad kritums nav nejaušība. Visa analīze kļuva lētāka no $36,27 līdz aptuveni $18, un galvenais modelis ar $8,64 tagad ir tās lielākā izmaksu pozīcija.

2. Vairāk domāšanas katrā solī

Gudrākiem modeļiem vajadzētu iztikt ar mazāk soļiem — to Anthropic teica, laižot klajā Opus 4.5. Prasībām vajadzēja tikpat soļu — modeļa izsaukumu — cik iepriekš, vērtēšanas kritērijiem aptuveni uz pusi mazāk. Katrā solī modelis domāja daudz vairāk.

11,1
izsaukumi uz prasību ar Haiku 5.5, salīdzinot ar 9,8–17,8 ar Haiku 4.5
6,0
izsaukumi uz vērtēšanas kritēriju, salīdzinot ar 11,0–18,1
13×
vairāk domāšanas vienā izsaukumā tam pašam piedāvājumam

Arī uzvednes kļuva lielākas: 80 000 tokenu pret 52 000, daļēji tāpēc, ka Haiku 5.5 to pašu tekstu saskaita kā aptuveni par 30% vairāk tokenu. Tam ir nozīme cenas robežas dēļ: līdz 100 000 tokenu vienā pieprasījumā Haiku 5.5 maksā desmito daļu no Haiku 4.5 cenas; virs tās viss pieprasījums maksā piecreiz vairāk. Šo robežu pārsniedza 187 no mūsu 724 izsaukumiem: ceturtā daļa izsaukumu, 68% no posma rēķina.

3. Stingrāk tam pašam piedāvājumam

7. un 8. izpilde lasīja identisku piedāvājuma versiju:

Prasības vērtējumsHaiku 4.5, 24. septembrisHaiku 5.5, 8. oktobris
Atbilst4935
Atbilst daļēji06
Nevarēja pārbaudīt18
Nav piemērojama34

Visas 14 izmaiņas virzījās prom no „atbilst“. Dažas ir labāki atklājumi, piemēram, iesniegšanas prasība, ko vecākā izpilde atzina par izpildītu, lai gan piedāvājumā nav augšupielādes apliecinājuma. Dažas ir pārāk stingras, piemēram, divi izslēgšanas iemesli, ko pasūtītājs pats pārbauda publiskos reģistros, palika nepārbaudīti. Vērtēšanas kritērijos bija otrādi: trīs no četrām izmaiņām daļēju vērtējumu paaugstināja līdz „atbilst“.

Ne viss te ir modeļa nopelns. Starp izpildēm mēs pievienojām norādījumu, ka par pierādījumu skaitās tikai pretendenta paša ieraksti, nomainījām konstatējumus pārbaudošo modeli no Sonnet 4.6 uz Sonnet 5.5 un mainījām to, kā dokumenti tiek pārvērsti tekstā. Lielākā daļa izmaksu krituma ir modeļa cena; vērtējumu izmaiņas pieder visam analīzes procesam, un viena izpilde tās nevar nodalīt.

4. Ko mēs no tā secinām

Turiet katra aģenta uzvedni zem 100 000 tokenu un, pirms uzticaties modeļa nomaiņai, palaidiet no jauna savus dokumentus, kā iesaka arī Anthropic Haiku 5.5 uzvedņu ceļvedis.

Katram Tendergate vērtējumam ir pievienots citāts un vieta dokumentā, uz ko tas balstās, tāpēc jebkuru vērtējumu, kas mainās pēc modeļa nomaiņas, var tieši pārbaudīt pret avotu.

Kā mēs skaitījām: astoņas produkcijas analīzes; galvenais modelis 1.–6. izpildē Opus 4.8, 7.–8. izpildē Opus 5.5. Izmaksas aprēķinātas pēc Anthropic publicētajām cenām, ieskaitot augstāko likmi virs 100 000 tokenu.

Uzziniet, kā MI var palīdzēt jūsu iepirkumos.
Izmēģiniet pirmo MI analīzi bez maksas.
Reģistrēties bez maksas

Avoti

  1. Iepazīstinām ar Claude Haiku 5.5 (Anthropic, 2026. gada 7. oktobris). Izlaišanas datums un apgalvojums par „aptuveni 75% mazākām“ darbināšanas izmaksām.
  2. Claude API cenas (Anthropic). Haiku 5.5 un Haiku 4.5 cenas, tostarp Haiku 5.5 augstākā likme virs 100 000 tokenu.
  3. Pāreja uz Claude Haiku 5.5 (Anthropic). Tas pats teksts ar Haiku 5.5 veido aptuveni par 30% vairāk tokenu.
  4. Uzvednes Claude Haiku 5.5 (Anthropic). Ieteikums salīdzināt piepūles iestatījumus ar saviem novērtējumiem.
  5. Iepazīstinām ar Claude Haiku 4.5 (Anthropic, 2025. gada 15. oktobris). Haiku 4.5 cena $1 un $5 par miljonu tokenu.
  6. Iepazīstinām ar Claude Opus 4.5 (Anthropic, 2025. gada 24. novembris). Apgalvojums, ka gudrāki modeļi problēmas atrisina mazākā soļu skaitā.
  7. Iepazīstinām ar Claude Opus 5.5 (Anthropic, 2026. gada 22. septembris). Galvenais modelis 7. un 8. izpildē.
  8. Iepazīstinām ar Claude Sonnet 5.5 (Anthropic, 2026. gada 28. septembris). Modelis, kas 8. izpildē pārbaudīja konstatējumus.
  9. Iepazīstinām ar Sonnet 4.6 (Anthropic, 2026. gada 17. februāris). Modelis, kas 1.–7. izpildē pārbaudīja konstatējumus.
Kā tapa šis raksts

Mēs veidojam mākslīgo intelektu iepirkumiem, tāpēc būtu mazliet dīvaini to neizmantot arī šeit. Šis raksts tapis kopīgi: mākslīgais intelekts - nenogurstoša lasīšana un pirmie melnraksti, cilvēki - vērtējums, labojumi un gala vārds.

Atpakaļ uz blogu