Se declaró la AGI. Lo que muestran las pruebas es otra cosa
Edición del 5 al 7 de septiembre · Panorama de IA para profesionales del sector
El caso de la semana
El CEO de NVIDIA declaró públicamente que la inteligencia artificial general ya llegó, a propósito del último modelo de OpenAI. La afirmación no resistió el contacto con quienes llevaban tres días probándolo.
- La evaluación de quienes lo usaron en serio es consistente y menos entusiasta: un modelo notablemente superior para construir cosas, con el contexto adecuado, pero sin las capacidades cognitivas que el término implica.
- El conflicto de interés es explícito. Quien vende el hardware sobre el que corren todos estos modelos tiene un incentivo directo en que el mercado crea que el umbral se cruzó.
- La objeción de fondo no es semántica. Cuando la etiqueta va por delante de la capacidad, las decisiones de adopción se toman contra una promesa y no contra una medición.
También esta semana
- Investigación. Un paper con firmas de peso en biología evolutiva y sistemas complejos modela la adopción de modelos de lenguaje como un proceso de contagio, con umbral crítico y dependencia persistente.
- Agentes. Los asistentes autónomos personales pasaron de demo a utilidad concreta: hay casos de recuperación de activos bloqueados en infraestructura técnica, operados a distancia desde el teléfono.
- Costos. Quedan seis días del nivel promocional de cuotas semanales, y persiste una confusión cara entre créditos comprados y límites del plan.
- Gobernanza. El científico jefe de OpenAI publicó un ensayo admitiendo que ningún laboratorio ha resuelto la alineación lo suficiente como para escalar a máxima velocidad.
Qué considerar
La distancia entre la declaración y la medición es hoy el principal riesgo de planificación. Ninguna organización debería ajustar un plan de adopción a partir de una declaración de un proveedor con posición en la cadena de valor. La prueba práctica es simple y barata: tome tres tareas reales de su operación, no benchmarks, y mida. La brecha entre lo que el modelo hace bien y lo que se afirma que hace suele aparecer en la primera tarde.
El costo de creerlo no es el gasto, es el diseño. Si un equipo asume capacidades que el sistema no tiene, deja de construir las verificaciones que necesitaba. El daño no aparece el día de la decisión sino meses después, cuando algo falla en un lugar donde nadie puso un control porque se dio por resuelto.
Antropomorfizar tiene un costo de ingeniería, no solo retórico. Decir que un agente "decide", "intenta" o "se resiste" describe con verbos de sujeto lo que es búsqueda de soluciones sobre un espacio de predicciones. La consecuencia práctica: si el modelo mental es el de una entidad con intenciones, se diseñan controles de comportamiento —persuadir, instruir, prohibir— en vez de controles de sistema: límites de acción, listas blancas, presupuestos, registros. Los segundos funcionan y los primeros no.
El ensayo del laboratorio dice más que el ensayo. Que el científico jefe de un proveedor frontera publique que la supervisión por cadena de razonamiento pierde fiabilidad a medida que los modelos se sofistican, y que la alineación no está resuelta lo suficiente para escalar sin freno, es una declaración de límites de su propio producto. Vale leerla como insumo de gestión de riesgo, no como filosofía. → https://openai.com/index/an-alien-mind/
El hallazgo de la semana

Se publicó un trabajo que aborda la adopción de modelos de lenguaje con las herramientas de la epidemiología: Large-Language Models as a Cognitive Virus, firmado entre otros por Ricard Solé, David Krakauer y Michael Levin. No es un panfleto, y por eso importa.
El modelo describe tres estados —no acoplado, acoplado y dependencia persistente— con transmisión social entre ellos y, crucialmente, un umbral a partir del cual la transición se vuelve abrupta: pérdidas rápidas de competencia a nivel de población, no gradual. La parte accionable es la otra mitad del argumento: el mismo marco identifica condiciones de protección, que los autores llaman inmunización cognitiva, y que se reducen a dos palancas —bajar la transmisión y facilitar la reversibilidad.
Traducido a decisiones de equipo, hay una formulación que resume bien el problema: la herramienta está optimizando el resultado de la tarea, no el aprendizaje que la tarea debía producir en quien la hace. Son objetivos distintos y por defecto solo se optimiza el primero.
Tres medidas concretas que se desprenden y que cuestan poco:
- Separe las tareas de entrega de las tareas de formación. No todas las tareas están para salir rápido. Algunas están para que alguien aprenda algo, y ahí la asistencia total es contraproducente.
- Conserve fricción deliberada en el trabajo de criterio. Redactar el argumento antes de pedir ayuda, revisar sin el asistente abierto, escribir la conclusión propia antes de contrastarla.
- Haga la reversibilidad barata. Documentación, decisiones registradas y procesos que un humano pueda retomar sin el sistema son lo que convierte una dependencia en una preferencia.
→ https://arxiv.org/abs/2609.03344
Agentes personales: de la demo al uso
El cambio más concreto del período no fue un lanzamiento sino un tipo de uso que empezó a aparecer con resultados verificables: agentes autónomos personales corriendo en infraestructura propia, operados remotamente desde el teléfono, resolviendo problemas técnicos reales. Un caso representativo: recuperar fondos bloqueados en un nodo de una red de pagos, algo que había resistido varios intentos manuales.
Lo relevante no es el monto sino el patrón. Tres condiciones lo hacen posible y las tres son replicables: el agente corre en una máquina propia con acceso al entorno real, la interfaz de control es asíncrona y liviana, y la tarea es acotada y verificable. Ese es el perfil de tarea donde estos sistemas hoy rinden por encima de su costo: problemas técnicos de nicho, con documentación dispersa y sin urgencia, que ningún humano va a priorizar.
La contraparte operativa, aprendida a golpes: limitar el paralelismo. Configuraciones con muchos subagentes simultáneos agotan memoria y degradan resultados; dos o tres en paralelo es el rango que la práctica está confirmando como estable.
Costos y límites

Quedan seis días del nivel promocional. Desde el 14 de septiembre las cuotas semanales se asientan en 125 sobre una base de 100: más que antes de la promoción, y 17% menos que el nivel al que los equipos ajustaron sus hábitos. Cualquier dimensionamiento hecho en agosto está inflado.
Hay además una confusión que está costando dinero y conviene aclarar internamente: los créditos comprados por separado y los límites del plan son dos contadores distintos. Un plan puede seguir funcionando después de marcar consumo completo porque está descontando de créditos adicionales, sin ninguna señal evidente. Vale revisar en qué contador está gastando cada cuenta del equipo antes de que aparezca en la factura.
Modelo de negocio

Apareció una herramienta de trabajo que vale más que varios anuncios de la semana: el Foro Económico Mundial publicó, con Kearney, un informe sobre operación y modelos de negocio AI-first cuya figura 21 es un lienzo de modelo de negocio adaptado. No propone tecnología: propone las preguntas.
Las que mejor funcionan como diagnóstico incómodo en una mesa de gerencia son cuatro: qué datos, modelos e infraestructura son activos estratégicos y cuáles son commodity; dónde la inteligencia mejora materialmente el resultado y no solo la velocidad; qué roles y capacidades siguen siendo distintivamente humanos y de alto valor; y qué pueden hacer sus clientes ahora que antes no podían. La última es la única que distingue una transformación real de una automatización con mejor prensa. → https://www.weforum.org/publications/the-ai-first-operating-system-a-blueprint-for-operating-and-business-model-innovation/
Para tu lista
Revisar esta semana
- Dimensionamiento de planes antes del 14 de septiembre
- En qué contador gasta cada cuenta: créditos comprados o límite del plan
- Paralelismo de subagentes en cualquier configuración agéntica en producción
- Qué tareas de su equipo están para entregar y cuáles para aprender
Lectura
- Large-Language Models as a Cognitive Virus — el modelo de umbral y las condiciones de reversibilidad
- An Alien Mind — el científico jefe de OpenAI sobre los límites de la supervisión actual
- The AI-First Operating System — Foro Económico Mundial y Kearney; el lienzo está en la figura 21
- Tools for Thought — línea de investigación sobre diseñar asistencia que fortalezca el pensamiento en vez de reemplazarlo
- Cognitive offloading, pensamiento crítico y profundidad de aprendizaje — evidencia empírica revisada por pares
Para agendar El 13 de septiembre termina el nivel promocional de cuotas. Es la única fecha dura del calendario de las próximas dos semanas.