1 de septiembre de 2026
Hay varias noticias que, vistas de forma aislada, parecen hablar de temas muy distintos: OpenAI retirando sus modelos de Cursor, Anthropic creando un estándar para controlar hardware con agentes, investigaciones sobre razonamiento multilingüe, nuevos métodos para construir agent harnesses, modelos locales capaces de ejecutar SQL y herramientas para evaluar agentes de voz.
Sin embargo, todas apuntan en la misma dirección.
La inteligencia artificial está entrando en una fase en la que el modelo fundacional deja de ser el producto completo. El rendimiento real depende cada vez más del sistema que lo rodea: memoria, herramientas, contexto, planificación, protocolos, validación, infraestructura, identidad, permisos y mecanismos de control.
El propio Global AI Weekly resume esa transición señalando que los agentes están saliendo del chat y del código para entrar en el mundo físico, mientras el acceso a modelos se vuelve más fragmentado y el agent harness adquiere tanta importancia como la capacidad bruta del modelo.
Mi lectura de esta edición es que estamos comenzando a pasar de la era del modelo a la era del sistema agentic.
OpenAI, Cursor y SpaceX: el acceso al modelo se convierte en riesgo estratégico
Una de las noticias más significativas de la semana no tiene que ver con un nuevo benchmark.
OpenAI comunicó que pretende finalizar el contrato mediante el cual suministra sus modelos a Cursor, después de la adquisición de la compañía por SpaceX. La fecha propuesta para el corte es el 12 de noviembre de 2026. OpenAI sostiene que no puede confiar suficientemente en que SpaceX utilice su tecnología conforme a los términos contractuales, citando experiencias anteriores con compañías de Elon Musk.
Hasta ahora, muchas organizaciones han tratado la selección de un modelo principalmente como una decisión técnica:
¿GPT, Claude, Gemini, Grok o un modelo open-weight?
Este caso demuestra que también es una decisión de continuidad empresarial y third-party risk management.
Una plataforma puede estar técnicamente integrada con un modelo y perder acceso meses después por una disputa comercial, una adquisición, una modificación contractual o un cambio en la política del proveedor.
La consecuencia arquitectónica es importante: las empresas deberían evitar diseñar sistemas en los que toda la lógica operacional dependa directamente de una única familia de modelos.
Un sistema empresarial resiliente debería separar, en la medida de lo posible, el modelo del resto de la arquitectura:
Aplicación → Harness → contexto/memoria → herramientas → políticas → router de modelos → modelo seleccionado
De esta manera, sustituir GPT por Claude, Gemini o un modelo local deja de significar reconstruir todo el sistema.
La portabilidad de modelos empieza a convertirse en un componente de AI resilience.
Comunicado oficial de OpenAI sobre Cursor y SpaceX
Anthropic quiere darle a los agentes acceso estandarizado al mundo físico
Probablemente la noticia con mayores implicaciones a largo plazo sea la presentación del Model Hardware Standard (MHS) de Anthropic.
MHS es una especificación común diseñada para permitir que agentes de IA operen dispositivos físicos mediante una interfaz compartida.
Los primeros escenarios incluyen:
microscopios, sistemas de manipulación de líquidos, brazos robóticos y hardware utilizado incluso en experimentos de computación cuántica. Anthropic afirma que el objetivo es reducir integraciones que actualmente pueden requerir semanas o meses a procesos de horas o minutos.
Esto representa una evolución enorme.
Hasta ahora, buena parte de la revolución agentic ocurre dentro de sistemas digitales:
Agente ↓API ↓Base de datos ↓Aplicación empresarial
MHS abre la puerta a:
Agente ↓MCP / interfaz MHS ↓Hardware ↓Proceso físico
Eso significa que el agente ya no solamente puede equivocarse al redactar un documento.
Puede mover un brazo robótico.
Modificar parámetros experimentales.
Operar equipamiento.
Alterar un proceso de fabricación.
Controlar instrumentos científicos.
La transición de AI Agents hacia Physical AI Agents cambia radicalmente la naturaleza del riesgo.
El problema de seguridad cambia cuando una decisión produce una acción física
En un chatbot, una alucinación produce información incorrecta.
En un agente empresarial, una alucinación puede modificar una base de datos.
En un agente conectado a hardware, una alucinación puede provocar una acción física.
Por eso Anthropic señala que trabajará con laboratorios e industrias para desarrollar evaluaciones de seguridad antes de abrir completamente el estándar.
Desde una perspectiva de gobernanza, una arquitectura de este tipo requerirá controles mucho más estrictos:
- autenticación del agente y del dispositivo;
- autorización granular por operación;
- límites físicos y lógicos;
- validación previa de comandos;
- human-in-the-loop para operaciones críticas;
- telemetría y trazabilidad;
- fail-safe states;
- kill switches independientes del propio modelo;
- separación entre percepción, decisión y ejecución.
Este probablemente será uno de los campos donde converjan con mayor fuerza AI Governance, OT Security, robotics safety y cybersecurity.
Model Hardware Standard — Anthropic
Una misma IA puede razonar mejor o peor dependiendo del idioma
Otro estudio de esta edición introduce un problema especialmente relevante para organizaciones globales.
Skill Issue: Are Skills Language-Invariant in LLMs? estudia si las capacidades de razonamiento de un modelo permanecen constantes cuando cambia el idioma.
Los investigadores evaluaron tres modelos open-weight, ocho idiomas y seis juegos mediante 518.400 partidas de self-play.
El modelo era el mismo.
Las reglas eran las mismas.
Las acciones disponibles eran las mismas.
Lo único que cambiaba era el idioma.
Y el rendimiento cambió significativamente.
Además, en determinados experimentos, cambiar únicamente el idioma utilizado durante el razonamiento interno recuperó hasta 89 % de la pérdida de desempeño.
Esto cuestiona una suposición bastante común:
Que un modelo que funciona bien en inglés ofrecerá automáticamente el mismo nivel de razonamiento en español, francés, alemán, árabe o japonés.
No necesariamente.
Multilingual AI Governance necesita evaluar comportamiento, no solo traducción
Para una empresa multinacional, esto tiene implicaciones relevantes.
Un modelo podría aprobar una evaluación de riesgo en inglés y comportarse de forma distinta utilizando exactamente el mismo escenario en español.
Por tanto, las pruebas multilingües no deberían limitarse a comprobar:
¿La traducción es correcta?
También deberían comprobar:
¿La decisión sigue siendo correcta?
Y especialmente:
¿Los controles de seguridad siguen comportándose igual?
Esto puede afectar sistemas relacionados con atención al cliente, recursos humanos, análisis financiero, compliance, seguridad, educación o decisiones asistidas por IA.
En términos de AI Governance, el idioma debería considerarse una variable del sistema evaluado, no únicamente una capa de presentación.
Skill Issue: Are Skills Language-Invariant in LLMs?
JIT-Agent demuestra que mejorar el harness puede ser más importante que cambiar el modelo
Otra investigación de esta semana probablemente anticipa uno de los cambios más importantes en arquitectura agentic.
JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution parte de una idea fundamental:
La capacidad de un agente no está determinada exclusivamente por el modelo.
El harness también importa.
En este contexto, el harness incluye elementos como:
memoria + planificación + protocolo de acciones + herramientas + skills + estrategia de ejecución
JIT-Agent intenta automatizar precisamente esa capa.
En lugar de utilizar un harness diseñado manualmente para todas las tareas, genera configuraciones específicas según el problema, las repara cuando fallan y aprende de ejecuciones anteriores.
Los resultados reportados son particularmente interesantes.
Con JIT-Agent, DeepSeek-V4-Flash superó a GPT-5.6 en DeepSearchQA por 9,1 puntos y en OdysseyBench por 4,3 puntos. Otros modelos también experimentaron mejoras importantes; GLM-5.2 obtuvo incrementos de hasta 20,2 puntos en los experimentos publicados.
Eso no significa que DeepSeek sea universalmente superior a GPT-5.6.
La conclusión realmente importante es otra:
Un modelo menos capaz con un harness mejor puede superar a un modelo más potente con una arquitectura peor.
El modelo no es el agente
Esta idea aparece repetidamente en esta edición.
Una forma útil de representarlo es:
AI AGENT
│
┌────────────┼────────────┐
│ │ │
Model Memory Context
│ │ │
└─────── Harness ─────────┘
│
Tools / Skills
│
Guardrails
│
Evaluation
│
Action
El modelo sigue siendo importante.
Pero es solo uno de los componentes.
Dos aplicaciones que utilizan exactamente el mismo modelo pueden tener niveles radicalmente diferentes de:
seguridad, fiabilidad, velocidad, coste y capacidad.
La diferencia puede encontrarse completamente en el sistema que lo rodea. Este es precisamente uno de los ejes centrales señalados por Global AI Weekly #165.
El cuello de botella de los agentes puede ser el feedback loop
La charla de Rob Zuber incluida en la edición plantea otro concepto relevante.
Cuando un desarrollador programa, utiliza un ciclo muy rápido:
Escribir ↓Ejecutar ↓Observar error ↓Corregir ↓Repetir
Un agente puede producir código mucho más rápido que una persona.
Pero si no dispone de feedback real, también puede equivocarse mucho más rápido.
Puede modificar veinte archivos, crear nuevas dependencias y ejecutar múltiples acciones mientras continúa persiguiendo una hipótesis equivocada.
CircleCI está trabajando precisamente sobre esa capa mediante mecanismos como validación remota y entornos capaces de proporcionar feedback durante el proceso de desarrollo agentic. Su enfoque de Chunk sidecars, por ejemplo, lleva validación de CI al ciclo local para que los agentes reciban retroalimentación mientras trabajan, no únicamente después del push.
Esto introduce un principio importante de Agentic Engineering:
Un agente rápido sin verificación puede producir errores más rápido.
La velocidad de generación no debería convertirse en la principal métrica.
La métrica realmente útil es:
velocidad para producir un resultado correcto y verificable.
Microsoft propone una regla sencilla: “solo creer lo que puede validarse”
Julia Kordick, de Microsoft, plantea precisamente este problema desde el contexto de modernización de aplicaciones.
Cuando un agente genera miles de palabras de documentación, cientos de líneas de código o migraciones completas, la revisión tradicional de “parece correcto” deja de escalar.
Su propuesta combina diferentes niveles de verificación:
herramientas deterministas, validación automatizada, análisis asistido por IA, pruebas de seguridad, revisión experta, trazas de producción y shadow testing.
La idea central es transformar:
plausibilidad
en:
evidencia verificable.
Esto probablemente será uno de los principios más importantes para desplegar agentes en producción.
Un sistema agentic no debería considerarse correcto porque “la respuesta se ve bien”.
Debería demostrarlo.
Microsoft — Only believe what you can validate
La evaluación de agentes también entra en CI/CD
Google está aplicando la misma lógica a los agentes de voz.
Su Agent Development Kit ahora permite realizar evaluaciones nativas de agentes live mediante usuarios simulados que generan conversaciones de audio.
Las pruebas pueden definir:
persona, objetivo de conversación, criterios de evaluación y métricas.
El sistema puede posteriormente puntuar conversaciones completas, inspeccionar llamadas a herramientas y ejecutar las evaluaciones desde CLI o dentro de pipelines CI/CD.
Eso representa otro cambio importante:
AntesDemo de voz↓"Funciona bien"AhoraAgent↓Simulated users↓Audio interactions↓Evaluation rubric↓Regression testing↓CI/CD
Los agentes están comenzando a recibir una disciplina de testing semejante a la que el software tradicional tardó décadas en desarrollar.
Google — Evaluate Live & Voice Agents in ADK
Los modelos locales comienzan a alterar la economía de la IA empresarial
Otro de los contenidos más interesantes viene de MotherDuck.
En sus pruebas, Qwen3.8 27B, ejecutado localmente junto con DuckDB, logró resultados muy competitivos en el benchmark DABstep para SQL.
Según MotherDuck, una ejecución local del modelo superó en ese benchmark a GPT-5.6 Luna Max mientras el coste estimado de electricidad se mantenía por debajo de USD 0,50, frente a más de USD 8 para la alternativa utilizada en su comparación.
Una variante cuantizada de 3 bits puede incluso ejecutarse en un MacBook Pro M1 con 16 GB de memoria, aunque con reducción de rendimiento frente a configuraciones de mayor memoria.
Hay que tratar estos resultados como lo que son: un benchmark elaborado por MotherDuck dentro de una configuración específica, no una demostración de superioridad universal.
Pero la tendencia sí es importante.
Estamos entrando en un mercado donde algunas tareas que hace pocos años necesitaban modelos frontier alojados en enormes clusters pueden comenzar a ejecutarse localmente.
Edge AI y modelos locales introducen una alternativa arquitectónica
El patrón tradicional ha sido:
Datos ↓Internet ↓Cloud API ↓Modelo ↓Respuesta
Pero cada vez más workloads permitirán:
Datos ↓Modelo local ↓DuckDB / aplicación local ↓Resultado
Esto puede cambiar varios elementos:
Coste: ciertas tareas repetitivas pueden ejecutarse con coste marginal muy bajo.
Privacidad: la información puede permanecer dentro del dispositivo.
Latencia: desaparece parte de la dependencia de red.
Soberanía: la organización controla directamente la ejecución.
Disponibilidad: el sistema puede continuar funcionando sin conexión permanente.
No significa que el cloud desaparezca.
La arquitectura probablemente será híbrida.
Los modelos locales resolverán una parte importante de las tareas y los frontier models serán escalados cuando el problema realmente lo requiera.
MotherDuck — Agentic SQL with Qwen3.8 and DuckDB
RAG tampoco es suficiente para todos los problemas empresariales
La edición también vuelve sobre un tema importante: las limitaciones del RAG tradicional.
Una búsqueda vectorial funciona muy bien cuando la respuesta se encuentra semánticamente cerca del texto de la pregunta.
Pero tiene problemas cuando necesitamos conectar múltiples relaciones.
Por ejemplo:
Empresa A │adquirió ↓Empresa B │dirigida por ↓Persona C
Una pregunta como:
“¿Quién dirige la compañía que adquirió Empresa A?”
requiere varios saltos lógicos.
Un RAG basado únicamente en similitud vectorial puede recuperar uno de los fragmentos pero no necesariamente conectar ambas relaciones.
GraphRAG introduce grafos de conocimiento para representar explícitamente estas conexiones y combinarlas con búsqueda semántica.
Esto refuerza otra conclusión de la edición:
el modelo no resuelve por sí solo el problema del conocimiento empresarial.
La arquitectura del contexto sigue siendo fundamental.
NVIDIA GTC Berlin muestra hacia dónde se mueve la industria
Global AI Weekly también destaca NVIDIA GTC Berlin 2026, que se celebrará del 20 al 22 de octubre.
La conferencia cubrirá más de 100 sesiones relacionadas con AI infrastructure, CUDA, agentic AI, robotics, open models y physical AI. Jensen Huang ofrecerá la keynote el 21 de octubre en el Tempodrom de Berlín.
Lo interesante es observar cómo ha cambiado la propia agenda de NVIDIA.
Hace pocos años, la conversación estaba dominada por GPUs y deep learning.
Ahora aparecen juntos:
infraestructura + modelos abiertos + agentes + robótica + physical AI
Eso refleja cómo el stack completo está convergiendo.
Lo que esta edición realmente nos está diciendo
Global AI Weekly #165 puede resumirse en una tesis:
La ventaja competitiva de la próxima generación de IA no estará determinada únicamente por quién tenga el modelo más potente. Estará determinada por quién construya el sistema más confiable alrededor del modelo.
Los modelos seguirán mejorando.
Pero el verdadero campo de batalla empieza a desplazarse hacia:
Models ↓Context ↓Memory ↓Harness ↓Skills ↓Tools ↓Identity ↓Verification ↓Governance ↓Action
Y cuando esos sistemas comienzan a operar software, bases de datos, infraestructura y eventualmente máquinas físicas, cada una de esas capas se convierte en una superficie de riesgo.
La implicación para AI Governance y GRC
Durante los primeros años de Responsible AI, gran parte de la gobernanza se concentró en el modelo:
sesgo, explicabilidad, privacidad, precisión y seguridad.
La IA agentic amplía radicalmente ese alcance.
Ahora debemos gobernar también:
- qué identidad utiliza un agente;
- qué modelos puede seleccionar;
- qué memoria conserva;
- qué herramientas puede ejecutar;
- qué sistemas puede modificar;
- qué dispositivos físicos puede controlar;
- cuánto dinero puede gastar;
- qué operaciones requieren aprobación;
- cómo se valida el resultado;
- qué ocurre cuando falla;
- cómo se reconstruye posteriormente la secuencia de decisiones.
En otras palabras:
AI Governance está evolucionando desde model governance hacia system governance.
Mi conclusión
Esta edición contiene muchas noticias interesantes, pero para mí hay tres especialmente importantes.
La primera es Model Hardware Standard. Significa que los agentes empiezan a salir definitivamente del entorno puramente digital.
La segunda es JIT-Agent. Refuerza la idea de que aumentar parámetros no es la única forma de aumentar inteligencia práctica. Mejorar el harness puede producir ganancias enormes.
La tercera es el énfasis creciente en verification. Microsoft, Google, CircleCI y otros actores están llegando a una conclusión semejante: los agentes no pueden desplegarse basándose únicamente en confianza estadística o en resultados que “parecen correctos”.
Necesitamos evidencia.
La arquitectura futura probablemente no se verá como:
Usuario → LLM → respuesta
Se parecerá mucho más a:
Usuario / Evento
↓
AI Agent
↓
Agentic Harness
┌────────────────────────────┐
│ Context │
│ Memory │
│ Planning │
│ Policies │
│ Identity │
│ Tools / Skills │
└────────────────────────────┘
↓
Model Router
↓
Local / Open / Frontier Models
↓
Verification
↓
Human Approval
cuando aplique
↓
Action
↓
Audit Log
Ese es probablemente el verdadero stack de la inteligencia artificial empresarial de los próximos años.
Y por eso la pregunta que deberíamos hacer ya no es solamente:
¿Qué modelo estamos utilizando?
La pregunta más importante es:
¿Qué sistema hemos construido alrededor de ese modelo para que sus decisiones sean seguras, verificables, gobernables y auditables?
Fuentes principales
La edición analizada corresponde a Global AI Weekly #165, 1 de septiembre de 2026, suministrada como fuente para este artículo.
Global AI Weekly — Global AI Community
OpenAI — Decision on Cursor following its acquisition by SpaceX
Anthropic — Model Hardware Standard
Hugging Face — Skill Issue: Are Skills Language-Invariant in LLMs?
Hugging Face — JIT-Agent
Microsoft — Verification framework for agentic AI
Google — Evaluating Live & Voice Agents in ADK
MotherDuck — Agentic SQL with Qwen3.8 27B and DuckDB
The New Stack — GraphRAG and multi-hop reasoning
NVIDIA GTC Berlin 2026
SEO recomendado para WordPress
Título SEO: Global AI Weekly #165: agentes físicos, AI harnesses y la nueva era de la verificación
Slug: global-ai-weekly-165-agentic-ai-harness-verification
Meta description: Global AI Weekly #165 analiza el salto de los agentes hacia el mundo físico, JIT-Agent, Model Hardware Standard, modelos locales, GraphRAG y la creciente importancia de la verificación y el AI Governance.
Categorías: Inteligencia Artificial · Agentic AI · AI Governance · Cybersecurity
Etiquetas: OpenAI, Anthropic, AI Agents, Agent Harness, MCP, Physical AI, AI Governance, JIT-Agent, GraphRAG, Google ADK, Qwen, NVIDIA GTC.