Ideas8 de julio de 2026lectura de 13 min

Mismo modelo, harness diferente

El modelo acapara los titulares, pero el harness, el sistema que construyes alrededor del modelo, decide silenciosamente cuánto cuesta el trabajo, si puedes confiar en él y si un error se vuelve algo aislado o una lección.

Neil Blackman
Neil BlackmanForward Deployed AI Engineer
Mismo modelo, harness diferente

Me propuse probar un harness que había construido. Lo que encontré es que el sistema que envuelves alrededor de una IA puede importar más que la IA que lleva dentro.

Respuesta corta: El modelo acapara los titulares, pero el harness, el sistema que construyes alrededor del modelo, decide silenciosamente cuánto cuesta el trabajo, si puedes confiar en él y si un error se vuelve algo aislado o una lección.

Pensé que estaba comparando dos revisores.

En realidad estaba comparando dos harnesses.

Lo noté en un panel. Una fila era Aegis, un sistema de revisión que venía construyendo. La fila justo al lado era Codex, ejecutándose en silencio sobre exactamente el mismo pull request, mirando exactamente la misma evidencia. Mismo trabajo. Misma entrada. Dos maneras completamente distintas de hacerlo.

Y en el momento en que miré de verdad los números, la pregunta que creía estar haciendo se reorganizó en otra distinta.

Déjame retroceder, porque “harness” está cargando con mucho peso en esa frase.

Una nota rápida sobre los harnesses

Si leíste El cerebro, el trabajo, la app, ya conociste esta idea; solo que la llamé de una forma más amable.

El modelo es el cerebro. Opus, Sonnet, Codex, el que elijas.

La app en la que lo ejecutas —Claude Code, una aplicación de escritorio, una herramienta de terminal— es el cuerpo y las manos. El nombre técnico de ese cuerpo es harness agéntico. La vez pasada dije que los llamaríamos simplemente apps. Este texto va sobre lo que ocurre cuando dejas de tratar al harness como un detalle y empiezas a tratarlo como aquello que decide si el trabajo vale algo.

Esta es la analogía a la que vuelvo una y otra vez.

Imagina que contratas a alguien brillante. Con talento de verdad. Ahora imagina dos versiones de su primer día.

En una versión, le señalas el edificio y le dices “adelante”. Deambula por todas partes, lee todo, recorre cada pasillo y al final vuelve con algo útil, pero le tomó el día entero y te costó una fortuna en su tiempo.

En la otra versión, le entregas el manual. Aquí está el trabajo. Aquí están los límites. Aquí está la lista de verificación. Así quiero que me reportes lo que encuentres.

La misma persona. El mismo talento. Un día completamente distinto.

Esa segunda versión es un harness.

Ya íbamos rápido

Algo de contexto, para que esta historia se mantenga honesta.

Este no era un equipo esperando sentado a que la IA nos hiciera productivos. En los últimos tres meses, entre Edgar, Gabe y yo, integramos 424 merges en nuestra rama de desarrollo. Eso son 4,56 cambios al día, o 6,33 por día hábil.

(Una traducción rápida por si “merge” y “pull request” son palabras nuevas: un pull request, o PR, es simplemente un lote propuesto de cambios esperando a que una persona lo revise y lo apruebe antes de que pase a formar parte del código real. Un merge es lo que ocurre cuando recibe el visto bueno).

PeriodoMerges a developmentRitmo por día naturalRitmo por día hábil
30 mar – 30 jun 20264244,56/día6,33/día hábil
30 dic 2025 – 29 mar 20264334,81/día6,77/día hábil

Esa segunda fila está ahí a propósito. No intento venderte una gráfica de palo de hockey donde la IA de pronto hizo que todo explotara. Ya éramos rápidos. El trimestre anterior fue, de hecho, un pelín más rápido.

Lo que cambió no fue el ritmo.

Lo que cambió fue que la revisión por fin pudo seguirle el paso al ritmo y que yo pude medirlo mientras ocurría.

La pregunta incómoda detrás de Aegis

Por esas fechas estaba sacando Aegis de AgentShelf para que viviera como su propio paquete independiente, y así poder mejorar el harness por separado sin arrastrar todo el producto con él.

Sonaba a una tarea de ingeniería ordenada. Pero debajo había una pregunta más difícil, y yo lo sabía.

¿El harness era realmente bueno?

No “bueno” como idea bonita que me gustaba. No bueno porque lo construí yo. Necesitaba saber si Aegis me daba algo que otros harnesses no, o si simplemente me gustaba como te gusta cualquier cosa que hiciste tú mismo.

Esa pregunta me resultaba familiar, y tardé un segundo en ubicar por qué.

Cuando construí Storyweaver, no sabía que estaba construyendo un harness. Creía estar construyendo una herramientita para escribir historias. Mirando atrás, las partes que de verdad importaban no eran el modelo en absoluto: eran el bucle, las personas de escritura, los archivos de capítulo, la biblia de la historia, el contexto que le seguía dando y el criterio humano en cada paso.

El modelo importaba. Pero la forma que construí alrededor del modelo importaba más.

Aegis era ese mismo instinto, por fin hecho explícito.

Dale al modelo un trabajo. Dale contexto. Dale reglas. Dale una manera de reportar lo que encontró. Y luego dale a la persona una manera de decidir si el trabajo realmente valía algo.

Johnny 5

Entonces Edgar construyó nuestro primer empleado digital: un revisor de PR.

Lo llamamos Johnny 5. Edgar creció con Cortocircuito (Short Circuit), yo también, y el nombre encajó al instante. Una maquinita servicial con algo de personalidad, metida en el flujo de trabajo, leyendo PR y manteniendo al equipo en movimiento. Un Johnny 5 dorado. Era perfecto.

La primera versión estaba escrita en Rust. Pequeña, compacta, útil. Vigilaba nuestro trabajo, revisaba cada PR conforme llegaba y dejaba comentarios sobre lo que encontraba. Ya hacía algo real.

Y justo por eso vi una oportunidad.

Si quería probar Aegis con honestidad, este era el lugar. El revisor ya tenía un trabajo real, riesgos reales y suficiente repetición como para que el harness alrededor del modelo se notara en los resultados. Así que lo reconstruí sobre Aegis y lo llamé PR Watch.

La reconstrucción cambió lo que la cosa era.

Pasó de “un bot que revisa PR” a algo que yo podía medir de verdad: vigila trabajo nuevo, actualiza su copia del código, ejecuta las mismas comprobaciones fijas cada vez, solo mira la evidencia que importa y guarda todo para que dos ejecuciones puedan compararse lado a lado en un panel.

La versión uno revisaba PR.

La versión dos convirtió la revisión de PR en algo que yo podía medir.

El primer baño de realidad

El PR 2217 fue la ejecución que me hizo palpable el equilibrio.

Era una corrección de error. Aegis lo revisó y llegó a la decisión correcta. Codex, corriendo en silencio en segundo plano sobre el mismo PR, llegó a la misma decisión, pero por el camino sacó a la luz un defecto genuino en el código modificado que Aegis no había señalado.

Aquí viene la parte que conviene dejar reposar. Antes de decirte el costo: los “tokens” son sencillamente el taxímetro corriendo en una IA. Cuanto más lee, escribe y hurga, más alto el número y más alta la factura.

PR 2217, iteración 2Aegis (revisión en vivo)Codex (revisión en sombra)
Tokens totales94.6562.312.581
Costo estimado$0,61$2,32
Duración137 s263 s
Veredictowait-for-authorwait-for-author
Múltiplo de tokens1x24,43x

Voy a ser honesto sobre cómo se sintió, porque fueron dos sensaciones a la vez.

La primera fue un orgullo silencioso. Algo que yo había construido llegó a la decisión correcta por sesenta y un centavos, mientras una configuración mucho más cara quemaba aproximadamente veinticuatro veces los tokens para aterrizar en el mismo sitio.

La segunda fue humildad. Codex detectó algo real que a Aegis se le escapó. Eso no es poca cosa. Esa es justamente la razón por la que todavía no confío en Aegis por sí solo.

Así que esto nunca fue una victoria limpia. Fue un equilibrio que por fin podía ver.

Y esto es lo que el harness me dio y antes no tenía: ese desacuerdo no se evaporó. PR Watch lo capturó y lo guardó como un elemento de aprendizaje. Hasta que Aegis pueda detectar ese tipo de problema por su cuenta de forma fiable, la segunda opinión cara se convierte en parte de cómo mejoro Aegis.

Codex es genuinamente bueno explorando. Recorre el código, inspecciona rutas, persigue posibilidades, sigue cavando. Eso es una fortaleza real.

Aegis hacía algo distinto a propósito. No recorría el edificio. Tenía el manual —el trabajo, los límites, la lista de verificación, el formato de reporte— y se mantuvo dentro.

El mismo tipo de cerebro. Distinta incorporación. Distinto resultado.

El patrón siguió apareciendo

El PR 2217 fue la primera vez que lo vi con claridad. No fue la última.

A lo largo de las primeras 25 ejecuciones en las que pude comparar ambos directamente, el mismo patrón apareció una y otra vez.

MedidaAegis (en vivo)Codex (en sombra)Diferencia
Ejecuciones comparables2525
Ejecuciones exitosas25 / 2524 / 25Aegis +1
Tokens totales promedio99.4412.687.16427,2x
Tokens totales agregados2.486.03167.179.09927,0x
Costo estimado promedio$0,60$2,574,28x
Duración promedio159 s278 s1,75x
Llamadas a herramientas promedio7689,2x
Auditorías de traza limpias18 / 2512 / 25Aegis +6

Lo útil de esa tabla no es que corone a un ganador.

Muestra la forma del equilibrio.

Aegis era más barato, más contenido y muchísimo más fácil de auditar después: cuando volvía a revisar su trabajo, el rastro tenía sentido. Codex era más caro, más exploratorio y, cada tanto, sacaba a la luz algo real que valía la pena incorporar de vuelta a Aegis. El deambular no era desperdicio. Parte de él era señal genuina.

Pero el costo y la forma del trabajo no estaban ni cerca.

Por qué soy cuidadoso con la afirmación

A medida que se acumulaban más ejecuciones de comparación, también pude ponerle número a esa señal de aprendizaje. Y aquí tengo que ser cuidadoso, porque sería fácil sobrevenderlo.

AlcanceEjecucionesHallazgo validado solo de CodexTasa
Reporte comparable original25936,0 %
Todas las ejecuciones de comparación con Codex431330,2 % (cota inferior)
Ejecuciones con artefactos de aprendizaje de Aegis251352,0 %
Filas de aprendizaje adjudicadas explícitamente241354,2 %

Ese 30,2 % es una cota inferior, y quiero ser claro sobre por qué. De las 43 ejecuciones de comparación, 18 no tenían artefactos de aprendizaje adjuntos. Esas filas son desconocidas, no una prueba de que Codex no encontrara nada. Prefiero reportar el piso honesto que una suposición halagadora.

En las ejecuciones donde sí tengo los comprobantes, Codex produjo un hallazgo real y validado que a Aegis se le escapó aproximadamente la mitad de las veces. Entre todas ellas conté unos 16 hallazgos únicos.

Eso no es un argumento de que Aegis esté terminado. Es lo contrario.

Es el argumento a favor del bucle.

Eso es lo que PR Watch me dio de verdad. No un trofeo de benchmark. Una manera de ver el sistema completo —incluidas sus carencias— con suficiente claridad como para mejorarlo a propósito.

Lo que el harness demostró

Ahora estoy sumando más harnesses a la comparación: Claude Code, Antigravity, modelos locales, lo que aparezca después. Pero lo principal ya me queda claro.

Aquello con lo que ejecutas el modelo importa.

El modelo también importa, obviamente. Pero el harness es lo que decide la economía del trabajo: cuánto cuesta, cuánto tarda, si puedes confiar en él, cómo falla y si un desacuerdo se convierte en una sorpresa aislada o en una mejora permanente.

Entonces, ¿era mejor mi harness?

No universalmente. Aegis está más enfocado, y el enfoque tiene un precio. Codex detectó cosas que Aegis no, y hasta que Aegis las detecte por su cuenta, estoy usando esos fallos para enseñarle.

Pero Aegis tenía ventajas reales donde contaba. Era más barato de ejecutar, más fácil de auditar, moldeado en torno a cómo trabajamos de verdad y construido para aprender exactamente de los puntos donde se quedó corto.

Esa es la parte de la que estoy más orgulloso. Para algo tan joven, Aegis podía pararse junto a configuraciones mucho más maduras y defenderse, no porque fuera más listo en todos los casos, sino porque estaba construido dentro del sistema que lo rodeaba.

Por qué esto importa si tú no construyes harnesses

Aquí va la parte para todos los que no se pasan la semana comparando conteos de tokens.

Toda la conversación sobre IA en este momento gira en torno al modelo. Cuál es más listo. Cuál elegir. Cerebro nuevo, titular nuevo, cada pocas semanas.

Pero para sacar trabajo real adelante, el modelo rara vez es lo que decide si la IA sale barata o cara, confiable o un riesgo, un truco de fiesta de una sola vez o algo que silenciosamente mejora en tu trabajo. Eso es el harness. El sistema alrededor del modelo.

Y casi nadie llega a elegir el suyo.

La mayoría conoce la IA como una caja de chat y un fichaje brillante sin manual: con talento, con ganas, y con la misma probabilidad de irse por las ramas y quemar una tarde que de clavar la tarea. Conozco bien a ese fichaje. Dejé que uno se ofreciera a borrar el setenta por ciento de Storyweaver, y le dije que adelante. El talento nunca fue el problema. El manual que faltaba, sí.

Esa es toda la razón por la que estamos construyendo AgentShelf. No para entregarte un cerebro mejor, esos ya los consigues en cualquier parte. Para entregarte el harness: el trabajo, los límites, la lista de verificación, la memoria, la manera de reportar. La incorporación, para que el talento se presente de verdad a tu trabajo, sin que tengas que destrozar un Storyweaver propio primero para aprender cómo.

El futuro que todos venden son modelos mejores.

El futuro por el que yo apuesto son mejores sistemas para ejecutarlos.

Neil Blackman

Neil Blackman

Forward Deployed AI Engineer

Core platform engineer on AgentShelf — built the workspace and the institutional context layer. Writes about building with AI at blog.neilblackman.dev.

¿Necesitas un agente para un flujo repetible?

Cuéntanos qué necesita tu equipo y solicita un patrón de agente que se ajuste al trabajo.

Tus opciones de privacidad

Usamos tecnologías opcionales de personalización del asistente, análisis y publicidad solo cuando lo autorizas. Las funciones necesarias del sitio permanecen activas. Política de cookies