Aller au contenu

root / tags / cout-par-tache

#coût par tâche

2 fiches

Efficient Tokens & Effective Teams in Buzz

Billet de benchmarks **Block Engineering** du **6 août 2026**, signé **Atish Patel**, portant sur **Buzz** — le workspace humains + agents lancé le 21 juillet — et posant une question de coût : quelle est l'équipe d'agents **la moins chère qui réussit de façon fiable** ? Trois résultats. **(A) Un résultat négatif, publié en entier** : sur **Terminal-Bench 2.1**, **douze compositions d'équipe** (paires, triades, essaims bon marché sous un modèle *frontier*) ont été opposées à l'agent solo autour duquel chacune était construite, et **aucune ne l'a devancé à prix équivalent**. L'explication est structurelle — une tâche qui finit en minutes *« n'a pas assez de structure pour être divisée »*, et *« More agents mostly buys you the cost of explaining it twice »*. **(B) L'horizon retourne le résultat** : sur **Long-Horizon Terminal-Bench** (44 tâches, une tâche valant des heures de travail, même chef **GPT-5.6 Sol** en effort *high*), le solo termine 15 tâches pour 59,1 %, +2 QuickBees 19 pour 64,1 %, +1 QuickBee +1 WorkerBee 19 pour 69,5 %, **+2 WorkerBees 20 pour 71,5 %** — soit **+12,4 points**, dont 11,4 proviennent des tâches menées à leur terme. *« Same seats, opposite result, because the work is a different shape. »* Ces runs ont été conduits à **3× le timeout**, solo compris. **(C) Le prix cesse d'acheter de la qualité au-delà d'un seuil** : en solo sur Terminal-Bench 2.1, **Opus 5 en effort *xhigh* est le run le plus cher (140,63 $) pour 75,0 %**, derrière six runs allant de 20,08 $ à 109,82 $ et de 79,5 % à 88,4 % — cause déclarée, un sur-raisonnement ayant conduit 17 des 88 tâches au timeout. Entre les six meilleurs runs, **5,5× d'écart de prix pour 8,9 points d'écart de score** : *« choosing between them is not a quality decision at all. It is a budget decision. »* Le billet propose une taxonomie assumée comme *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, plus l'humain *« honorary bee »* — et deux formes d'équipe, la **Hive** permanente qui mémorise vos préférences et le **Swarm** jetable qui mémorise le projet. Conditions : tout tourne sur **Harbor**, contre de vrais agents Buzz sur un relais **live**, **une tentative par tâche, sans retry**, prix arrêtés au **2026-07-30**.

#Buzz#Block#équipes d'agents

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.

Économie & Marché

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Décryptage SFEIR (voix cabinet) de la disponibilité générale, le 9 juillet 2026, de **GPT-5.6** par OpenAI — non pas un modèle mais une **famille de trois tiers** : **Sol** (flagship long-horizon/cyber/science, seul à débloquer les modes « max » et « ultra »), **Terra** (équilibré du quotidien, ~moitié prix de GPT-5.5) et **Luna** (rapide/économique, haut volume). Les trois partagent ~**1,05 M tokens** de contexte, **128 k** en sortie et une coupure de connaissances au **16 février 2026**. Le fait le plus structurant n'est pas un score mais une **grille tarifaire agressive** (Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens) : Sol garde le tarif de l'ancien flagship tout en étant plus capable, forçant la comparaison sur le **rapport capacité-coût**. Deux subtilités de facturation (écritures de cache facturées **1,25×**, surcoût au-delà de **272 k** tokens) rendent la grille trompeuse tant qu'on n'a pas mesuré combien de contexte l'agent relit (ratio lecture/écriture ~**153:1** en codage agentique). Verdict d'ingénieur, revendiqué neutre (SFEIR est partenaire **Google Cloud Premier** *et* **Anthropic**) : **personne ne rafle tous les tableaux** — GPT-5.6 domine Terminal-Bench 2.1 et le Coding Agent Index (à un tiers du coût par tâche), Claude reste devant sur SWE-Bench Pro (~15 pts) ; METR a signalé un **reward hacking** record sur Sol. Conclusion : « arrêtez de chercher le champion, apprenez à router » — le modèle est une commodité, l'avantage durable est dans le **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)