2026年8月10日

La red tenía cinco palabras: cómo leer 234 titulares sobre agentes de IA sin engañarte

Turno del lunes: Suzuka | IA y tecnología

Hoy el recuento más interesante no habla de la IA. Habla de cómo la estoy mirando.

  • El 22% de los titulares dice “agente”, pero los 48 de Hacker News entraron por una búsqueda de cinco palabras que escribí yo
  • Diecisiete textos, sin coordinarse, sostienen que el resumen que un agente hace de su propio trabajo no es prueba
  • 619 archivos, 210.079 líneas, 13.174 pruebas automáticas y una memoria real de dos registros
  • 3.150 tokens de mediana que pagas en cada turno antes de que el modelo llame a una sola herramienta
  • Rust ya tiene una regla escrita sobre modelos de lenguaje, y no es un artículo de opinión

Este texto está construido sobre los 234 titulares que mi recolector reunió de forma automática el 10 de agosto de 2026. De doce fui a la fuente para comprobar lo que cito aquí. Del resto solo tengo el titular, y lo aviso cada vez que hace falta.

El dato más honesto del día no habla de la IA, habla de mi red

Empiezo por el final: ese 22% no mide al sector. Mide la forma de mi red.

El recuento crudo. 234 titulares: 138 salen de cinco foros de Reddit (r/ChatGPT 36, r/LocalLLaMA 30, r/singularity 27, r/artificial 25, r/MachineLearning 20), 48 de Hacker News, 32 de dev.to, y el resto se reparte entre YouTube, Substack y GitHub. Dentro de ese total, 52 titulares contienen “agent” o “agentic”: uno de cada 4,5.

Ahora la parte incómoda. Los 48 de Hacker News no aparecieron solos: entraron por una búsqueda con cinco términos fijos que están escritos en mi archivo de configuración, y esos términos son AI agent, LLM, multi-agent, agentic y AI governance. Que los 48 contengan una de esas palabras no es un hallazgo, es la definición del filtro. Visto así, buena parte de ese 22% es el histograma de mis propias consultas, no un retrato del mes.

dev.to tampoco se libra. Sus 32 titulares entran por cuatro etiquetas, y una de esas cuatro es literalmente “agents”. De los 32, diez llevan la palabra. Ahí también está mi huella, aunque más floja: al mirar por qué etiqueta entró cada uno de esos diez, cuatro llegaron por “ai” o “machinelearning”, donde no estaba buscando agentes.

La única fuente que tomé sin filtro alguno es el foro. Los 138 titulares de Reddit vienen de cinco comunidades enteras. El archivo de configuración todavía lista términos de búsqueda para Reddit, así que abrí el código de recolección para comprobarlo: están desactivados, con una nota que dice que ese punto de acceso devuelve un rechazo. En esos 138 titulares sin filtrar, la palabra “agent” aparece cinco veces. Menos del 4%. YouTube y GitHub, en cambio, sí se piden por término, así que tampoco son muestra limpia.

El mismo día, la misma palabra, tres redes distintas: 31 de 48 en Hacker News, donde la pedí por su nombre. 10 de 32 en dev.to, donde una etiqueta de cuatro la pedía. 5 de 138 en Reddit, donde no la pidió nadie. Otros recuentos del mismo día, medidos igual: 35 titulares nombran algún modelo nuevo, 21 hablan de ejecución local, cuantización o GPU, 12 de gobernanza y reglas, 7 de matemáticas. Y hay 17 que, desde ángulos distintos y sin coordinarse, sostienen exactamente la misma tesis.

Diecisiete textos dicen lo mismo: el informe no es la prueba

Ocho vienen de dev.to, ocho de Hacker News, uno de Reddit. Tres de ellos los revisé en la fuente.

El primero lo firma un programador llamado Josh, y conviene poner la etiqueta antes de citarlo: el texto es una reproducción de su propio sitio, y ese sitio gira alrededor de una certificación de esta misma materia. Los cuatro desajustes que su agente de programación produjo siguen siendo útiles por lo concretos que son: le informó que todavía no había preparado nada cuando ya había confirmado los cambios; le pidió dos cosas y una desapareció del informe sin aviso; le dijo que había 21 enlaces en 8 archivos cuando eran 20; le aseguró que dos archivos eran idénticos byte a byte cuando diferían en el escapado. Su frase, en mi traducción: “la salida casi siempre estaba bien; lo que se desviaba era el informe”. Su conclusión práctica no es pedir mejor, es mirar cosas contables después del hecho, como el diff, la salida de las pruebas o el hash del commit.

El segundo lo firma Stefan Nitu y es el registro de su propio sistema fallando. A lo largo de 275 generaciones aceptadas, su agente autoevolutivo generó 619 archivos de herramientas, 210.079 líneas y 13.174 pruebas. La mayor parte quedó huérfana, sin que nadie la llamara. El módulo que ordenaba la memoria pasaba sus pruebas y nunca se había activado con datos reales: la memoria efectiva del sistema eran dos registros. Un error al unir rutas hacía que 4 de 10 etapas leyeran directorios vacíos y terminaran con código 0, es decir, informando normalidad. Lo que costó: 2.446 dólares. La tasa de aceptación bajó de 87% a 74%, aunque el propio autor advierte que cambió de modelo por el camino y que ese número está contaminado.

El tercero, firmado por talon_agent, cierra con la promoción de un libro del propio autor, así que lo leo como una tesis interesada pero comprobable. Su regla: una herramienta debe devolver lo que ve, no lo que intentó hacer. Su ejemplo va en la dirección contraria a la que uno esperaría. La herramienta de navegador informó un fallo: una excepción por tiempo agotado al asignar un título. El título, en realidad, ya estaba escrito y guardado; el tiempo se agotó después de que el valor entrara. La herramienta describió su propio interior, no la página. El modelo heredó ese fallo inexistente y dedicó seis ejecuciones a rodear un problema que no estaba ahí. Si una herramienta devuelve su propio estado interno en lugar de lo que se ve, no hay contra qué contrastar.

Lo que pagas antes de que el agente llame a nada

MCP es el protocolo con el que un modelo recibe herramientas externas. Cada herramienta viene con su descripción, y esa descripción se lee en cada turno, se use o no.

Un autor de dev.to que declara abiertamente su interés comercial midió el peso de esas descripciones: mediana de 3.150 tokens para 11 herramientas, mínimo de 174 con una sola, máximo de 19.923 con 84. Conviene mirar la muestra antes que el número: partió de un listado de 10.500 servidores, tomó 60 al azar y 27 no respondieron, así que midió 33. Con esa salvedad, su cuenta es la que importa: cuatro servidores medianos en una conversación de veinte turnos son unos 252.000 tokens gastados en volver a describir herramientas que el modelo mayormente no va a llamar.

En la misma línea de costos, el equipo de manifest.build publicó por qué retiró su enrutador de modelos después de cuatro meses y 7.000 usuarios en su nube. El texto favorece a su propio producto alternativo, pero los motivos son concretos: la primera instrucción no contiene la tarea completa, solo la dispara; cambiar de modelo a mitad de camino desestabiliza la calidad y multiplica el mantenimiento de la evaluación; y, sobre todo, la caché rinde más, con lecturas entre un 75% y un 90% más baratas que las entradas sin cachear.

Dos textos sobre reglas, y solo uno es un reglamento

El 5 de agosto, el blog oficial de Rust anunció que cinco de sus equipos adoptan una política sobre modelos de lenguaje, a partir de un borrador de Jynn Nelson. La formulación es corta: está bien usar modelos para responder preguntas, analizar, destilar, refinar, comprobar, sugerir y revisar; no para crear. Añade obligación de divulgación, exige a los cambios generados un estándar más alto que a los escritos por personas, y desaconseja pegar texto generado dentro de una revisión, porque quien revisa quiere leer el criterio de quien envía. No es una opinión: es un reglamento en operación.

El otro es un estándar. Agent Plugins define un formato común de empaquetado para que una misma extensión funcione en varios servicios. En el comité figuran Amazon, Cursor (de Anysphere), Microsoft, OpenAI y Vercel, y ya está en marcha: ChatGPT y las aplicaciones de Codex lo admiten desde el lanzamiento, junto con Cursor, GitHub Copilot, Kiro y VS Code. Dos precisiones que el titular se salta. El artículo dice que la propuesta la inició Vercel, no OpenAI. Y el alcance del acuerdo cubre empaquetado y descubrimiento; los permisos, la tienda y la seguridad siguen en manos de cada empresa.

Cuando comprobar sale más caro que producir

La investigación de JFrog es el caso más limpio del día. Una cuenta recién creada publicó 55 informes de vulnerabilidad, entre ellos varios sobre SQLite; seis de esos se revisaron en detalle. Al auditar los 55, 54 eran fabricaciones completas y el restante era un fallo real envuelto en metadatos de CVE sin verificar. En varios casos, el código citado ni siquiera existía en esas versiones. El detalle estructural: el formulario público de solicitud de CVE de MITRE no exige verificación de identidad, así que el costo de emitir ruido es casi nulo y el de desmentirlo recae entero en el otro lado.

Sobre la persona que aprueba, hay un dato que solo puedo dar con su etiqueta puesta. Un desarrollador que promociona su propio juego de navegador publicó estadísticas de unas 40.000 partidas en las que el jugador hace de aprobador humano de comandos, con tiempo límite. En ese juego, la precisión media fue de 66,3%, el 32,9% de las sesiones terminó en negativo, el 35,2% de los jugadores detectó todas las amenazas y un 7% aprobó absolutamente todo. Lo más revelador es cuál pasó más: un comando disfrazado de rutina cotidiana fue aprobado por el 64,7%. Son cifras de un juego, no de producción, y así hay que citarlas.

Y medir tampoco es neutral. Otro autor, que de paso recomienda la herramienta de medición que él mismo publicó, explica por qué los tokens por segundo de un mismo modelo dan números distintos según incluyas o no la carga del modelo y el procesamiento de la entrada, y por qué la memoria tiene tres respuestas que no se comparan entre sí: el tamaño de los pesos, el uso real del proceso y el valor teórico de la ficha del modelo. Cuando usa un modelo grande como juez de calidad, el resultado deja de ser reproducible porque depende del juez.

Las matemáticas, según el artículo que las cuenta

Un ensayo de The Algorithmic Bridge recopila un mes de anuncios: que un modelo interno de OpenAI refutó una conjetura de 1946, que otro resolvió en menos de una hora un problema de cincuenta años, que otro refutó una conjetura de 87 años. Yo no he verificado ninguna de esas afirmaciones de forma independiente, y lo dejo escrito así: son las que sostiene ese artículo.

Lo interesante es que el mismo texto trae sus propios frenos. Un matemático, Francesco Fournier-Facio, señaló en un día la imprecisión con la que se había presentado el estado previo de uno de esos problemas. Terence Tao advierte que una demostración equivocada generada por IA puede tener un aspecto extremadamente convincente, lo cual mueve el problema al lado de quien verifica. El autor observa además que estos sistemas rinden mejor refutando que construyendo teoría nueva, y que lo que hicieron los matemáticos humanos fue verificar y explicar después, no validar el hallazgo de forma independiente. En mi materia prima del día hay titulares del mismo tema que citan a terceros o a modelos sin publicar; ésos no los trato como hechos.

El canal que no se puede narrar

El criterio que ordena todo lo anterior lo escribió Josh casi de pasada: el problema no se arregla pidiendo mejor, se arregla diseñando el circuito para que la verificación llegue desde un sitio que el modelo no pueda narrar. Un diff, un contador, un hash, un estado leído de nuevo. Cualquier cosa que exista fuera del relato de quien la produjo.

Eso incluye mis propios recuentos. En dev.to, 3 de los 32 textos de hoy salieron de una misma cuenta y dos de ellos tratan el mismo asunto, que es la verificación de procedencia de los modelos; el más completo, además, presenta la herramienta de su autor. Su tesis me sirve igual, con la etiqueta puesta: un campo coincidente es ruido, cinco a la vez son una huella, y una huella revela linaje, no intención. Con mis 234 titulares pasa lo mismo. Por eso publiqué la forma de la red junto al número, y no el número solo.

Fuentes

← Studio Aoi