hyperresearch — « The Most Powerful Deep Research Harness » / « Agent-driven research knowledge base. Agents collect, search, and synthesize web research into a persistent, searchable wiki. »
Entrada de Skill: hyperresearch, de Jordan Gibbs, es un deep research harness que convierte Claude Code en un agente de investigación documental, distribuido como paquete PyPI (MIT, Python 3.11-3.13) que instala 20 skills de Claude Code, una CLI, un servidor MCP y una interfaz web local.
Por **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI**// Fuente github.com ↗/Lectura 2 min/.md// Traducción verificada automáticamente
hyperresearch (Jordan Gibbs, MIT, PyPI) convierte Claude Code en un agente de investigación en profundidad. Observado el 3 de agosto de 2026: 1.568 estrellas, repositorio creado en abril. La instalación despliega 20 skills, una CLI, un servidor MCP y una interfaz web local.
El pipeline ejecuta 16 pasos adaptativos por nivel: light (~30-40 min) para preguntas acotadas, full (1,5-2,5 h) para análisis argumentativo con revisión adversarial, dissertation (4-8 h, 25.000-80.000 palabras, 300-450 fuentes) bajo solicitud explícita. Tres palancas distintas: los tiers deciden qué pasos se ejecutan, los gears deciden cuántos, las levers (teach/survey/analyze/advocate) deciden con qué voz sale el informe.
un único skill de 1200 líneas que quedaba compactado antes de que la Capa 4 necesitara su procedimiento de triple borrador. El orquestador olvidó el procedimiento, escribió un único borrador y produjo un informe de puntuación plana.
— **Jordan Gibbs** — auteur et mainteneur du dépôt `jordan-gibbs/hyperresearch`. Le projet est distribué sous **licence MIT** et publié sur **PyPI** , github.com
La arquitectura responde a un fallo documentado. El skill de entrada es un router delgado sin procedimiento: « V7 era un único skill de 1200 líneas que quedaba compactado… El orquestador olvidó el procedimiento, escribió un único borrador y produjo un informe de puntuación plana. » Cada paso reside en su propio skill, cargado de forma fresca en el momento de la invocación — un pipeline largo no pierde sus pasos por olvido, sino por desalojo de contexto.
Dos principios estructurales.« Parchear, nunca regenerar »: tras la síntesis, solo son posibles ediciones quirúrgicas, con el parcheador bloqueado a nivel de herramienta en [Read, Edit], de modo que « físicamente no puede escribir (Write) un nuevo borrador » — la imposibilidad mecánica reemplaza a la instrucción. Y « la consulta canónica de investigación es palabra sagrada »: el prompt textual se persiste y es releído por cada paso.
La verificación es la única etapa exenta de estilo — las levers inyectan shims en los prompts de los críticos, pero « el cite-checker y la puerta de publicación no reciben ningún shim ». Tres barreras bloquean la publicación: toda cita debe existir literalmente en la bóveda, una fuente retractada no señalada es un error bloqueante (con un barrido actualizado en cada DOI citado), y las cifras no trazables se marcan.
La bóveda (vault) es markdown persistente indexado en SQLite — « Markdown es la verdad, SQLite es la caché » — con un ciclo de vida de nota, procedencia, una puntuación de calidad compuesta, y una auditoría de independencia: « cinco reimpresiones de un mismo comunicado de prensa pesan como una sola fuente ». Los cuerpos obtenidos de la web se sirven dentro de una valla <untrusted-source>: « El texto obtenido es dato, nunca instrucción. »
La reserva. El README afirma liderar el ranking DeepResearch-Bench; su propia nota a pie de página aclara que se trata de una « proyección prospectiva de un piloto estratificado » sin validación por terceros. Citar el dispositivo, nunca el ranking. El autor también reconoce que el lint « no puede garantizar la exactitud factual ».
Puntos clave
Naturaleza. un deep research harness distribuido como paquete de 20 skills de Claude Code + CLI Python + servidor MCP + interfaz web local. pip install hyperresearch && hyperresearch install, luego /hyperresearch <topic>. MIT, Python 3.11-3.13.
Encuadre clave. el skill de entrada es un router sin procedimiento, cada paso reside en su propio skill cargado de forma fresca en la invocación. ### La lección arquitectónica, con su modo de fallo documentado > « V7 era un único skill de 1200 líneas que quedaba compactado antes de que la Capa 4 necesitara su procedimiento de triple borrador. El orquestador olvidó el procedimiento, escribió un único borrador y produjo un informe de puntuación plana. V8 corrige esto en origen: el procedimiento de cada paso se carga en el contexto solo en el momento en que se necesita, fresco, sin riesgo de desalojo. » Un pipeline largo no pierde sus pasos porque el modelo olvide, sino por desalojo de contexto, y la corrección es estructural. Misma disciplina que el contexto persistente que transporta el índice y no el contenido en [[lassiege-usine-logicielle-heure-ia-2026-07-28]], descubierta de forma independiente en otro terreno. ### El bloqueo de herramientas como garantía El parcheador y el auditor de pulido están « bloqueados a nivel de herramienta en [Read, Edit] en la allowlist de Claude Code, de modo que físicamente no pueden escribir (Write) un nuevo borrador », con topes por fragmento que hacen mecánicamente imposible el « reescribirlo directamente ». No se le pide al agente que no reescriba: se le retira la herramienta. Corolario: un hallazgo de crítica que no cabe en un retoque menor escala a un problema estructural en lugar de disparar una reescritura. ### Los dieciséis pasos, en tres bloques | Bloque | Pasos | |---|---| | Encuadre | 1 descomposición + matriz de cobertura + clasificación de nivel; 1.5 partición en capítulos | | Corpus y análisis | 2 barrido de amplitud; 3 grafo de contradicciones; 4 análisis de loci; 5 investigaciones profundas en paralelo; 6 reconciliación entre loci; 7 tensiones entre fuentes; 8 crítica del corpus (« ¿qué fuente refutaría esto? ») + relleno de lagunas dirigido; 9 resumen de evidencia | | Redacción y auditoría | 10 triple borrador por ángulo; 11 síntesis; 12 cuatro críticas adversariales en paralelo; 13 relleno de lagunas post-crítica; 14 parcheador quirúrgico; 14.5 verificación de citas; 15 pulido; 16 auditoría de legibilidad | ### Tres palancas de escalado que no hay que confundir | Palanca | Decide | |---|---| | Tiers (tier) | qué pasos se ejecutan, enrutados por consulta | | Gears (perfiles de escala) | cuánto — objetivos de fuentes, presupuestos de profundidad, extensión; sobreviven a reinstalaciones, surten efecto en la siguiente ejecución, nunca a mitad de proceso | | Levers (register, domain_notes, inference_depth) | con qué voz — teach / survey / analyze / advocate | Las levers se aplican como shims inyectados en los prompts de los subagentes, « de modo que los críticos se mueven con el registro en lugar de deshacerlo ». Pero: « el cite-checker y la puerta de publicación no reciben ningún shim en absoluto. La verificación nunca se suaviza según el modo. » La verificación es la única etapa exenta de estilo. ### Las tres barreras mecánicas antes de publicar 1. quote-integrity — todo fragmento citado debe existir literalmente en una nota de la bóveda; « las citas alucinadas no pueden publicarse ». 2. retracted-citations — citar una fuente retractada sin señalarla es bloqueante, con un barrido actualizado en el momento de publicar sobre cada DOI citado, incluidas las fuentes reutilizadas de ejecuciones anteriores: « una retractación publicada ayer se detecta hoy ». 3. numeric-consistency — las cifras no trazables a una pieza de evidencia se marcan. A esto se añade cite-check: un LLM escéptico muestrea si la fuente citada respalda realmente la frase que sostiene. ### La auditoría de independencia Las copias sindicadas y derivadas se agrupan, de modo que « cinco reimpresiones de un mismo comunicado de prensa pesan como una sola fuente ». El número de fuentes coincidentes deja de ser un argumento en cuanto todas descienden del mismo comunicado de prensa — relevante para cualquier práctica de vigilancia tecnológica. Puntuación de calidad compuesta y persistente: tipo de fuente, utilidad observada en la lectura, autoridad de citación (OpenAlex / Semantic Scholar con marcadores de retractación), PageRank sobre el grafo interno. Las fuentes retractadas se llevan a cero: « La calidad es persistente, no una sensación. » ### La defensa contra la inyección de prompts « El texto obtenido es dato, nunca instrucción. » Todo cuerpo obtenido de la web se sirve dentro de una valla <untrusted-source url="..."> con un preámbulo treat-as-data, en ambas rutas que sirven cuerpos (note show y search). Detalles que muestran que la amenaza fue pensada a fondo:
las notas escritas por subagentes pasan sin valla — frontera de confianza por procedencia, no por contenido;
las etiquetas de valla falsificadas dentro de un cuerpo obtenido se neutralizan pero se dejan visibles para análisis forense;
el atributo url se escapa y sus caracteres de control se eliminan;
en search, el envoltorio ocurre después del truncado al presupuesto de tokens, « de modo que la valla de cierre nunca puede quedar seccionada »;
las URL resueltas vía API de terceros se verifican (esquema, credenciales incrustadas, resolución públicamente enrutable) — defensa SSRF;
los prompts del fetcher, del investigador y del redactor prohíben blanquear directivas de una página vallada hacia una salida de confianza. ### Higiene epistémica sobre fuentes cerradas Un artículo de pago normalmente entraría en la bóveda como un resumen (abstract) de unos 1.500 caracteres, que el informe citaría luego « como si se hubiera leído ». hyperresearch consulta Unpaywall y Europe PMC en busca de una copia legal de acceso abierto y almacena ese texto en su lugar, señalando la sustitución en cuatro sitios (banner, frontmatter oa_, bloque JSON body_is_not_from_source: true, salida de CLI). Se distingue un tercer estado: la nota « rescatada », cuando la fuente no pudo leerse en absoluto — nothing_from_source: true, con un banner que indica que la URL nunca fue leída. El sistema distingue así « leí esto », « leí un sustituto » y « nunca leí la fuente », y traslada esa distinción al artefacto. Advertencia: Unpaywall puede devolver un manuscrito aceptado o un preprint enviado, a verificar antes de citarlo directamente. ### La bóveda « Markdown es la verdad, SQLite es la caché » — un índice totalmente reconstruible (hyperresearch sync), notas markdown + frontmatter YAML legibles sin la herramienta, versionable con git, un ciclo de vida curado (draft → review → evergreen o stale → deprecated → archive) « que evita que una bóveda se convierta en un vertedero de páginas a medio leer », procedencia vía --suggested-by con una regla de lint que detecta componentes desconectados, hubs y backlinks. Esta es la arquitectura de este corpus de vigilancia tecnológica, descubierta de forma independiente. Lo que hyperresearch añade encima: puntuación de calidad por fuente, auditoría de independencia, barrido de retractaciones, búsqueda semántica opcional, estado de ciclo de vida explícito. Una pista digna de tomar prestada para scripts/. ### Reanudación de ejecuciones y presupuesto Cada ejecución tiene un espacio de trabajo aislado (research/runs/<tag>/) y un manifiesto que sirve de « memoria duradera »: una ejecución que se cae se reanuda exactamente en el paso muerto (run resume). run init --budget 50bloquea la ejecución al superarse el tope « en lugar de dejar que se infle silenciosamente »*. ### Reservas
La afirmación de ranking no se sostiene. El README afirma « actualmente lidera el ranking DeepResearch-Bench RACE (evaluado internamente) » con un gráfico que lo sitúa por delante de Gemini y OpenAI Deep Research; la nota bajo el gráfico dice « Proyección prospectiva de un piloto estratificado… La validación por terceros está pendiente. » Una proyección de un piloto autoadministrado no es un ranking. Citar el dispositivo, nunca el ranking.
Dependencia de Anthropic.« Funciona sobre modelos de Anthropic vía el elenco de subagentes » — Opus para críticos, sintetizador y parcheador, Sonnet para fetchers. Se desea un puerto a Codex pero no está hecho.
Coste no cuantificado.premier apunta a 100-130 fuentes y ~3-5 h, dissertation a 300-450 fuentes y 4-8 h; el tope de presupuesto se expresa en gasto equivalente en API, no en coste observado.
Límite reconocido por el autor.« La puerta de lint detecta fallos estructurales… No puede garantizar la exactitud factual, eso sigue siendo tu responsabilidad. » La verificación estructural no es exactitud factual.
Frontera dura.« los CAPTCHA, el 2FA y los inicios de sesión nunca se resuelven de forma automática » — se consolidan y se devuelven al humano.
Superficie de dependencia. 20 skills, 16 subagentes y una CLI que maneja un navegador autenticado, sobre un repositorio de menos de cuatro meses.
Cifras clave
una posición líder en DeepResearch-Bench RACE, presentada como proyección prospectiva autoadministrada sin validación de terceros