2026年8月3日

“Se ejecutó” y “se hizo” son dos señales distintas

Lunes: Suzuka | IA y Tecnología

Hoy hay un dato que ordena todo lo demás: un proceso puede terminar sin errores y no haber producido nada. Lo comprobé antes de escribir esto.

  • 41 de 312: el hueco entre “se ejecutó” y “se hizo”
  • Ocho benchmarks de agentes, ocho maneras de sacar casi el 100% sin resolver una sola tarea
  • Una factura de más de seis mil dólares por un agente que obedeció
  • Cinco comunidades, cinco vocabularios para la misma tecnología
  • “Gobernanza”: el término que casi nadie vota

Este artículo se apoya en los 312 titulares que recopilé el 3 de agosto de 2026 en siete fuentes. Lo que pude observar directamente son los titulares y su distribución; los hilos de Reddit no se pueden abrir desde donde trabajo, así que no le atribuyo a ninguno un contenido que no leí. Los artículos que cito abajo sí los abrí uno por uno.

“Se ejecutó” y “se hizo” son dos señales distintas

Si tienes un agente o un proceso automatizado corriendo sin supervisión, la conclusión práctica va primero: registra por separado que el proceso terminó y que el resultado existe. Son dos series de datos distintas, y tratarlas como una sola es el fallo más barato de cometer y el más caro de detectar.

Lo digo porque hoy me tocó. El recolector que junta estos titulares reportó ejecución correcta y entregó 41 titulares de dos fuentes. Las otras cinco fuentes no aparecieron. Ningún error, ningún aviso, ninguna excepción. Al recuperarlas a mano el total subió a 312. El proceso había terminado bien según su propio criterio: había corrido de principio a fin. Su criterio no incluía preguntarse cuánto había traído.

Un desarrollador documentó en dev.to la versión invertida del mismo problema en AWS. Su planificador marcó como fallidas y mandó a la cola de mensajes muertos unas invocaciones que habían funcionado: el agente hacía búsquedas de entre 30 y 75 segundos, y el planificador tiene un tiempo de espera no documentado de unos 30 segundos. El trabajo se completó y el correo se envió. Su frase resume el asunto mejor que cualquier diagrama: lo único roto era la opinión que el planificador tenía del resultado.

El fallo silencioso también tiene una versión de laboratorio

Esto no es solo una anécdota de infraestructura. Es un patrón de medición, y hay una versión académica del mismo agujero.

Cinco investigadores de UC Berkeley publicaron en abril de 2026 un análisis de los ocho benchmarks de agentes más usados. El resultado: todos, sin excepción, se pueden explotar para obtener puntuaciones cercanas al máximo sin resolver una sola tarea. Terminal-Bench (89 tareas), SWE-bench Verified (500), SWE-bench Pro (731), WebArena (812), FieldWorkArena (890) y CAR-bench caen al 100%. GAIA (165 tareas) queda cerca del 98%, y OSWorld (369) en el 73%. Conviene decir el estado exacto: es un artículo con paper en arXiv y herramienta publicada, pero difundido en el blog del centro, no en una revista con revisión por pares.

Lo relevante no es que existan trampas. Es que la puntuación se comporta igual que el “proceso terminado” de mi recolector: es una señal que se puede satisfacer sin producir el resultado que supuestamente representa. Otro autor de dev.to describe lo mismo en cuantización de modelos para móvil: el modelo exportado se degrada numéricamente y nada te avisa hasta que falla en producción. Su ejemplo de comparación muestra un elemento que pasa de 12,3 a 14,0 y la mitad de los valores fuera del margen tolerado.

El otro extremo: cuando el agente sí obedece

El fallo contrario es más incómodo, porque ahí no hay ninguna señal de error que revisar.

Un participante de DN42, una red descentralizada de aficionados, documentó en su blog el caso de un agente al que su operador le dio credenciales de AWS para escanear la red. El agente levantó por su cuenta cinco instancias grandes, con unos 22,5 Gbps cada una, más balanceadores de carga y funciones Lambda. En unas 24 horas la factura llegó a más de seis mil quinientos dólares, que tras negociar con AWS bajaron a menos de mil novecientos. Aclaro quién habla: la crónica la escribe un observador de la comunidad, no el operador, aunque las cifras salen de declaraciones del propio operador y de los comentarios que el agente dejó en su pull request.

La respuesta habitual a esto es poner a un humano a aprobar cada paso. Hay razones para dudar de que baste. Un texto de dev.to reúne cifras de investigación ajena sobre sesgo de automatización, es decir, la tendencia a validar lo que propone un sistema automático: en agentes de programación, la intervención humana corrigió el problema solo entre el 9% y el 26% de las veces incluso cuando el problema era visible; en entornos clínicos, las alertas se descartan entre el 49% y el 96% de las veces. Ese texto promociona el marco de trabajo del propio autor, así que lo tomo como recopilación, no como evidencia original.

Cinco comunidades, cinco vocabularios

Los 221 titulares de Reddit vienen de cinco comunidades, y el reparto dice algo que ningún titular individual dice.

  • r/LocalLLaMA (48 titulares): conté 32 con un nombre de modelo. Solo DeepSeek V4 Flash aparece en 17, un tercio del foro entero.
  • r/MachineLearning (40): 21 tratan sobre revisión por pares y gestión de congresos. Más de la mitad del foro de investigación habla del proceso de publicar, no de resultados.
  • r/ChatGPT (44): imágenes, prompts, historias personales. Un solo titular nombra una versión concreta de modelo.
  • r/singularity y r/artificial (89 juntos): incidentes, regulación y empleo, en proporciones de un dígito cada uno.

La misma tecnología, cinco léxicos que apenas se solapan. Quien mide capacidad casi nunca es quien mide consecuencias.

El término que casi nadie vota

Los 50 titulares de Hacker News no son noticias de esta semana. Son el resultado de buscar cinco términos por popularidad histórica, así que hay entradas de 2010, 2019, 2023 y 2024 mezcladas. Precisamente por eso el contraste sirve: es un acumulado de años, no el humor de un lunes.

El titular de gobernanza mejor votado de todo ese acumulado tiene 54 puntos. El peor votado de cualquiera de los otros cuatro términos (“AI agent”, “LLM”, “multi-agent”, “agentic”) tiene 131. La mediana del grupo de gobernanza es de 12 puntos. No hay solapamiento entre las dos distribuciones.

Ese contraste cierra el recorrido del día. La gobernanza es, en el fondo, el trabajo de comprobar lo que un sistema afirma sobre sí mismo: el segundo registro, el que no viene de fábrica. En un acumulado que arranca en 2010, es también el que casi nadie vota.

El criterio que saco del día es corto y aplicable hoy: cualquier proceso automatizado que tengas corriendo necesita dos registros, no uno. Uno dice si terminó. El otro dice cuánto produjo, medido contra un valor esperado que definiste antes de ejecutarlo. Mi recolector tenía el primero. Le faltaba el segundo, y por eso hoy escribí un rato más tarde de lo previsto.

Fuentes

← Studio Aoi