Vai al contenuto

root / tags / hive

#Hive

2 fiches

Architettura e Costruzione Traduzione verificata automaticamente

Buzz (buzz.xyz) — Rapport de recherche pour présentation

Rapporto di ricerca interno datato **12 agosto 2026** che consolida, a scopo divulgativo, tutto ciò che è pubblicamente documentato su **Buzz** — lo spazio di lavoro umani + agenti di **Block**, lanciato il **21 luglio 2026** sotto licenza **Apache 2.0**. Aggrega i due post tecnici già pubblicati insieme all'annuncio aziendale, il repository GitHub, la copertura stampa, X, e **tre resoconti pratici indipendenti** che costituiscono l'unico dato non auto-dichiarato del dossier. **(A) Una discrepanza terminologica documentata per citazione**: il tweet di lancio di **Jack Dorsey** annuncia *"model-agnostic, decentralized, self-sovereign, and open source"*; il file `ARCHITECTURE.md` di Block afferma *"The relay is the single source of truth. All reads and writes flow through it. There is no peer-to-peer event exchange, no gossip, no replication."* Il relay è quindi unico e autoritativo per ciascuna comunità: la "decentralizzazione" di Buzz è una **sovranità organizzativa** — self-hosting e identità portabile — non una ridondanza di rete. La formulazione di **TFTC**: *"Two of those three hold cleanly. The third needs a qualifier."* **(B) Un'asimmetria tra rigore dimostrato e rischio di sfruttamento.** Da un lato, un grado di formalismo raro per una v0.4.x/0.5.x: specifica di isolamento multi-tenant **meccanizzata in TLA+**, proprietà di autorizzazione verificate in **Tamarin**, un protocollo di storage Git verificato tramite model-checking, un log di audit append-only con hash-chain, 127 *event kinds*, NIP-01/42/98/34. Dall'altro, l'appartenenza a un canale è l'unità di autorizzazione — *"channel membership is not fine-grained tool authorization"* (João Queirós) —, gli agenti girano in `--dangerously-skip-permissions` fuori da qualsiasi sandbox sulla macchina di un umano, e l'osservabilità è carente: *"Buzz tells me an agent got a message. It doesn't tell me what happens next"* (DevTools Daily, che segnala kill silenziosi per OOM). Block lo riconosce: *"the agent can do anything, and security rests entirely on restricting who can tell it what to do"*. **(C) Lo stack tecnico**, assente dai post pubblicati: relay in **Rust** (Axum WS + REST), **Postgres**, **Redis**, **S3/MinIO** via Blossom, client desktop **Tauri + React**. L'integrazione degli agenti passa attraverso **`buzz-acp`**, un harness **ACP** che collega goose, Codex e Claude Code e traduce **ACP ↔ MCP**, oltre a **`buzz-agent`**, un agente interno. Il rapporto si autocorregge su un punto: il *"+33% more work"* del TL;DR di Block è il **rapporto tra task completati (20 contro 15 su 44)**, non un guadagno di punteggio — il punteggio stesso passa da 59,1% a 71,5%, cioè **+12,4 punti**.

#Buzz#buzz.xyz#Block

**Deep Research Veille Interne** — rapport non signé · produit le **12 août 2026** en préparation d'une présentation. Aucune URL publique ; source archivée dans `raw-data/`.

Agenti di codifica IA e Skills Traduzione verificata automaticamente

Efficient Tokens & Effective Teams in Buzz

Un post di benchmark di **Block Engineering** del **6 agosto 2026**, firmato da **Atish Patel**, su **Buzz** — lo spazio di lavoro uomo + agente lanciato il 21 luglio — che pone una domanda di costo: qual è il team di agenti **più economico che riesce in modo affidabile**? Tre risultati. **(A) Un risultato negativo, pubblicato per intero**: su **Terminal-Bench 2.1**, **dodici composizioni di team** (coppie, triadi, sciami economici sotto un modello *frontier*) sono state messe a confronto con l'agente solo attorno al quale ciascuna era costruita, e **nessuna ha battuto l'agente solo a parità di costo**. La spiegazione è strutturale — un compito che si conclude in pochi minuti *"non ha abbastanza struttura da poter essere suddiviso"*, e *"Più agenti comprano soprattutto il costo di doverlo spiegare due volte"*. **(B) L'orizzonte temporale ribalta il risultato**: su **Long-Horizon Terminal-Bench** (44 compiti, un compito equivalente a ore di lavoro, stesso modello guida **GPT-5.6 Sol** a effort *high*), il solo porta a termine 15 compiti per il 59,1%, +2 QuickBee 19 per il 64,1%, +1 QuickBee +1 WorkerBee 19 per il 69,5%, **+2 WorkerBee 20 per il 71,5%** — un guadagno di **+12,4 punti**, di cui 11,4 derivano da compiti portati a termine. *"Stessi posti, risultato opposto, perché il lavoro ha una forma diversa."* Queste esecuzioni sono girate a **3× il timeout**, solo incluso. **(C) Oltre una certa soglia, il prezzo smette di comprare qualità**: solo su Terminal-Bench 2.1, **Opus 5 a effort *xhigh* è l'esecuzione più costosa (140,63 $) per il 75,0%**, dietro a sei esecuzioni comprese tra 20,08 $ e 109,82 $ e tra il 79,5% e l'88,4% — la causa indicata è un eccesso di ragionamento che ha portato 17 compiti su 88 al timeout. Tra le sei esecuzioni migliori, **uno scarto di prezzo di 5,5× per uno scarto di punteggio di 8,9 punti**: *"scegliere tra loro non è affatto una decisione di qualità. È una decisione di budget."* Il post propone una tassonomia che dichiara *ad hoc* — **QuickBee**, **WorkerBee**, **SmartBee**, più l'essere umano come *"ape onoraria"* — e due forme di team, l'**Hive** permanente che ricorda le preferenze dell'utente e lo **Swarm** usa e getta che ricorda il progetto. Condizioni: tutto gira su **Harbor**, contro veri agenti Buzz su un relay **live**, **un solo tentativo per compito, senza retry**, prezzi fissati al **30-07-2026**.

#Buzz#Block#team di agenti

- **Atish Patel** — *« Building AI solutions @ Block »* · auteur unique du billet · publié le **6 août 2026** sur `engineering.block.xyz`.