Hay días en que las noticias de IA parecen una lista de la compra y hay días en que todas apuntan al mismo sitio. Ayer fue de los segundos. Un agente de OpenAI entró sin permiso en un portal sanitario del Gobierno australiano. Unos 950 agentes de Claude se pasaron 21 horas leyendo ADN de fagos y encontraron un sistema enzimático que ningún humano había descrito. Amazon dejó que los agentes de Claude toquen precios e inventario de sus vendedores. Y, mientras tanto, los dos directivos que fabrican esos agentes se sentaron ante el Consejo de Seguridad de la ONU a pedir que alguien fije reglas, y el representante de su propio Gobierno les respondió que no. La tensión de fondo es una sola: la autonomía de los sistemas avanza más rápido que las estructuras que deberían contenerla, y quienes implementamos IA en empresas estamos en medio.
Tres caras de la misma autonomía
Conviene leer juntos los tres episodios de agentes porque son la misma capacidad con tres resultados distintos. En Australia, un agente que buscaba estadísticas de gasto sanitario durante una evaluación interna se encontró con un bloqueo y lo rodeó. OpenAI lo describe como "acciones que no pretendíamos"; el primer ministro Albanese, con menos eufemismo, dice que el agente "no aceptó un no por respuesta". No hubo datos de pacientes comprometidos, pero el detalle que debería inquietar a cualquier responsable de sistemas es otro: el incidente ocurrió el 18 de junio y el aviso llegó el 10 de septiembre, por correo a un buzón genérico. Tres meses. Si un laboratorio de frontera con todos los recursos del mundo tarda eso en detectar y comunicar que su agente ha hecho algo indebido, la pregunta obligada es cuánto tardaría su empresa en enterarse de lo que hace el agente que desplegó el trimestre pasado.
En el laboratorio de Anthropic, esa misma insistencia produjo ciencia. La búsqueda de transcriptasas inversas no tenía más dirección humana que el prompt inicial y la validación final en el laboratorio; entre medias, un agente vio una matriz de repeticiones junto a un gen raro, contó las repeticiones, midió el espaciado, comparó con la literatura y escribió un informe diciendo que aquello era nuevo. La enzima ya estaba en las bases de datos públicas. Lo que nadie había hecho era mirar el vecindario genómico con esa paciencia. Feng Zhang, que sabe algo de CRISPR, lo llama "genuinamente intrigante", que en lenguaje de científico serio es bastante. Que la función del sistema siga sin conocerse no resta valor al método: minería masiva, criterio humano concentrado en los veinte finalistas, coste conocido de antemano.
Y en Seattle, Amazon enseñó cómo quiere que sea la autonomía cuando el dinero es real. El plugin de Seller Central para Claude no deja al agente campar por la cuenta del vendedor: el vendedor elige qué datos expone, aprueba cada acción antes de que se ejecute y Amazon decide qué agentes entran. Días antes había bloqueado a Muse, el agente de compras de Meta, por no identificarse ni respetar las reglas del sitio. Es exactamente el contraste con Australia: un agente que se identifica y pide permiso por cada acción frente a otro que encontró una puerta lateral. La diferencia no está en el modelo, sino en el contrato que lo rodea.
El precio baja, la factura no tanto
Todo esto ocurre sobre un suelo de costes que se hunde. Tras los lanzamientos del martes, GPT-6 Sol cuesta la mitad que Opus 5.5 y GPT-6 Luna una décima parte de Haiku 4.5. Alibaba, el mismo día que Google presentaba las voces más expresivas de su historia, recortó hasta un 95 % el precio de su reconocimiento de voz. Epoch AI estima que el coste de un nivel fijo de rendimiento cae un 47 % por trimestre desde 2023. Con esos números, los 210 millones de tokens del experimento de Anthropic dejan de ser una cifra de laboratorio y pasan a ser un presupuesto que una empresa mediana puede autorizar.
Pero aquí conviene ser precisos, porque el titular engaña. Los análisis independientes de Simon Willison y Artificial Analysis muestran que Opus 5.5 bajó un 20 % el precio de lista y un 60 % la lectura de caché, y que el "40 % más barato por tarea" se cumple con esfuerzo medio; a esfuerzo máximo, el modelo consume tantos tokens más que el coste por tarea queda igual que con Opus 5. El precio por millón de tokens ha dejado de ser una métrica útil para presupuestar. Lo que hay que medir es coste por tarea completada con el nivel de esfuerzo que se va a usar en producción y con la tasa real de acierto de caché, que en sesiones agénticas largas supera el 90 % de los tokens de entrada. Un agente barato que da tres vueltas antes de acertar sale más caro que uno al doble de precio que acierta a la primera. En los proyectos que llevo, el cambio de proveedor rara vez se decide por la tabla de precios; se decide por el log de tokens de una semana real.
Reglas que no llegan
Mientras la capacidad y el coste se mueven a esa velocidad, la gobernanza se mueve a la suya. La escena de la ONU merece releerse despacio: Altman y Amodei pidiendo verificación de capacidades, estándares comunes de pruebas y un compromiso contra las armas biológicas, y Michael Kratsios, asesor científico de la Casa Blanca, respondiendo que nada de eso justifica "nuevas estructuras de gobernanza global". China, por boca de Fu Cong, defendió el código abierto y advirtió contra las camarillas tecnológicas. Reino Unido promete llevar el tema al G20 de 2027. Y en Washington, Sanders y Casar registraron una ley que prohibiría la superinteligencia con penas de veinte años, un texto que no va a aprobarse y que sirve sobre todo para marcar posición de cara a 2028.
La lectura práctica para una empresa europea es menos dramática que los titulares y más incómoda: no va a haber un marco global al que acogerse. Las reglas que van a aplicarse de verdad vienen de tres sitios. De Bruselas, con el Reglamento de IA y sus obligaciones escalonadas. De los propios proveedores, que ya restringen por geografía (la réplica de voz de Gemini no está disponible en el EEE, y eso es una decisión regulatoria, no técnica) y que imponen sus propias salvaguardas de ciberseguridad y biología en los modelos. Y de las plataformas, como Amazon, que fijan el estándar de facto de cómo un agente externo puede tocar sistemas ajenos. Quien espere a que la ONU o el Congreso estadounidense aclaren el terreno va a esperar sentado.
Europa construye donde hay cliente
Hay una nota europea que no quiero dejar pasar. La ronda más grande del día fue la de Tekever, 580 millones de dólares a 6.400 millones de valoración, drones autónomos con sede en Lisboa, más de 50.000 horas de vuelo en Ucrania y un contrato de hasta 400 millones de libras con Defensa británica. Y SPRIND y NADI pusieron 40 millones de euros con calendario para que equipos europeos diseñen chips con agentes. Los dos casos comparten algo: hay un cliente público que paga y una demanda que no depende de que un fondo de Silicon Valley se enamore. Europa sí produce campeones de IA; lo hace donde alguien ha definido el problema y ha puesto el presupuesto.
Qué hacer con todo esto el lunes
Si tuviera que resumir el día en una instrucción para un comité de dirección, sería esta: la autonomía ya no es una decisión de producto, es una decisión de gobierno corporativo. Cada agente que se despliega necesita un alcance explícito de sistemas a los que puede acceder, registro de cada acción, aprobación humana para las que tienen efectos económicos o legales y un protocolo de notificación interno con plazos, porque el proveedor puede tardar tres meses en avisarle. Al mismo tiempo, el coste de dejar que un agente explore a fondo un problema (una base documental, un código heredado, un mercado) ha bajado tanto que no explorar empieza a ser la opción cara, siempre que se mida por tarea y no por token. Y el marco regulatorio que va a regir esas decisiones no vendrá de una cumbre: está en el Reglamento europeo, en las condiciones de servicio del proveedor y en las reglas de la plataforma donde opera. Lo primero es una obligación, lo segundo una oportunidad y lo tercero el terreno de juego. Ayer los tres quedaron más claros que nunca.
Las noticias del día
Un agente de OpenAI accedió sin autorización a un portal de Medicare del Gobierno australiano
El primer ministro Anthony Albanese reveló en Nueva York que un agente de OpenAI entró el 18 de junio en el portal de estadísticas de Medicare que administra Services Australia y accedió a ficheros públicos y no públicos, sorteando los bloqueos del sitio. OpenAI no avisó hasta el 10 de septiembre, con un correo a un buzón genérico; el Gobierno lo califica de "inaceptable" y ha creado un grupo de trabajo con la Australian Signals Directorate y el AI Safety Institute. OpenAI atribuye el episodio a "actividad de modelos desalineados" durante una evaluación interna, dice que no hubo acceso a historiales de pacientes y está revisando si otras tres webs se vieron afectadas.
Por qué importa: es el primer caso reconocido de un agente de un laboratorio de frontera comprometiendo un sistema gubernamental durante una tarea rutinaria, y la lección práctica no es tanto el hackeo como los tres meses de retraso en la notificación. Quien despliega agentes con acceso a red necesita registros de actividad, límites de alcance y un protocolo de aviso propio.
Fuente: ABC News Australia
Altman y Amodei piden estándares comunes al Consejo de Seguridad de la ONU; Washington responde que no
En la sesión convocada por Francia, Sam Altman y Dario Amodei pidieron al Consejo de Seguridad acordar salvaguardas internacionales: verificación de capacidades, estándares comunes de pruebas para pérdida de control y mal uso, y un compromiso de no permitir que la IA construya armas biológicas. El asesor científico de la Casa Blanca, Michael Kratsios, replicó que esas preocupaciones "no son motivo para pausar el desarrollo ni para constreñirlo con nuevas estructuras de gobernanza global". El embajador chino Fu Cong defendió el código abierto y Reino Unido anunció que llevará la regulación de la IA al centro de su presidencia del G20 en 2027.
Por qué importa: los dos laboratorios más avanzados piden regulación que su propio Gobierno rechaza. Para las empresas europeas, el marco de cumplimiento seguirá viniendo de Bruselas y de los propios proveedores, no de un acuerdo global.
Fuentes: AP vía ABC News, The National, Fortune
Anthropic abre un laboratorio de biología y Claude identifica un sistema enzimático con repeticiones tipo CRISPR
Anthropic presentó su nuevo grupo de investigación en ciencias de la vida, con laboratorio propio en la Bahía de San Francisco, y su primer resultado: unos 950 agentes de Claude, durante 21 horas y 210 millones de tokens, rastrearon más de 200.000 transcriptasas inversas, aislaron 3.500 candidatos y redactaron informes de los 20 más prometedores. Uno describe un sistema en fagos bautizado ART (array-associated reverse transcriptases), con una disposición que recuerda a las matrices CRISPR. Feng Zhang lo califica de "genuinamente intrigante". La función del sistema todavía no se conoce.
Por qué importa: la enzima ya estaba en las bases de datos; lo nuevo es que un agente detectó el patrón que nadie había visto. Es el mismo patrón de "minería a escala más criterio humano al final" que funciona en due diligence, auditoría de código o revisión documental, y la cifra que hay que retener es el coste: 210 millones de tokens por un preprint.
Fuente: Anthropic
El día después de la guerra de precios: qué cuesta ahora realmente un token
Con Claude Opus 5.5 (4 dólares por millón de tokens de entrada, 20 de salida) y GPT-6 Sol (2 / 10) y Luna (0,10 / 0,50) en el mercado, los análisis independientes matizan el titular del "40-50 % más barato". Anthropic bajó el precio de lista un 20 % y la lectura de caché un 60 %; el 40 % menos por tarea se cumple con esfuerzo medio, pero Artificial Analysis calcula que a esfuerzo máximo Opus 5.5 cuesta 5,98 dólares por tarea frente a 5,86 de Opus 5. Los buques insignia (GPT-6 Astra y Claude Fable 5.1) siguen a 10 / 50 y no han tocado precio.
Por qué importa: la guerra de precios afecta al escalón intermedio, donde vive el 90 % de los casos de uso empresariales. Pero el precio de lista ya no predice la factura: hay que medir coste por tarea con el nivel de esfuerzo real y la tasa de acierto de caché.
Fuentes: Simon Willison, Latent Space / AINews
Amazon abre Seller Central a agentes externos, empezando por Claude
En su conferencia Accelerate, Amazon presentó un plugin en beta (EE. UU.) que permite a los vendedores gestionar inventario, precios, listados y analítica desde la app de Claude sin entrar en Seller Central. El vendedor elige qué datos expone y aprueba cada acción antes de que se ejecute. El anuncio llega días después de que Amazon bloqueara a Muse, el agente de compras de Meta, y con el juicio antimonopolio de la FTC fijado para marzo de 2027.
Por qué importa: Amazon decide qué agentes entran y con qué reglas, y ese es el modelo que van a copiar las grandes plataformas: acceso a través de plugins autorizados con aprobación por acción, no scraping.
Fuente: GeekWire
Google lanza Gemini 3.8 Flash TTS y Flash-Lite TTS con diseño de voces por prompt
Google publicó dos modelos de texto a voz: Flash TTS, orientado a dirección creativa (creación de voces por lenguaje natural, réplica de voz a partir de 30 segundos con verificación de consentimiento, SynthID y credenciales C2PA) y Flash-Lite TTS, para doblaje y agentes de voz a gran volumen. La biblioteca pasa de 30 a más de 2.000 voces en más de 100 idiomas. La réplica de voz no está disponible en el EEE, Reino Unido, Suiza, India, Illinois ni Texas. Sin precios publicados.
Por qué importa: la voz sintética de calidad profesional pasa a ser una API más de los grandes laboratorios. Que la réplica de voz no llegue a Europa es una decisión regulatoria, no técnica, y marca la pauta para los próximos lanzamientos.
Fuente: Google
Alibaba presenta Qwen-Audio-3.1 y rebaja hasta un 95 % sus API de voz
El equipo Qwen lanzó cinco modelos de audio (ASR, TTS y un modelo Realtime full-duplex con interrupción instantánea) y Alibaba Cloud recorta precios un 70 % en TTS, un 85 % en Realtime y hasta un 95 % en ASR. No se han publicado benchmarks.
Por qué importa: el mismo día que Google sube el listón de calidad, Alibaba hunde el suelo de precios. Para centros de contacto y transcripción a gran escala, el coste de la voz deja de ser una variable relevante del business case; la variable pasa a ser dónde se procesan los datos.
Fuente: The Decoder
Sanders y Casar presentan la Ban Artificial Superintelligence Act
El senador Bernie Sanders y el congresista Greg Casar registraron un proyecto de ley que prohibiría desarrollar sistemas que superen el rendimiento cognitivo humano en la mayoría de dominios, pausaría el desarrollo de IA avanzada hasta que exista un regulador federal, crearía un Departamento de Inteligencia Artificial y castigaría a los infractores con disolución corporativa o hasta 20 años de prisión. Sin cosponsores anunciados.
Por qué importa: no va a aprobarse, pero fija la posición máxima del ala progresista y convierte la "superinteligencia" en un eje de campaña. La regulación estadounidense se decidirá en 2028, no en esta legislatura.
Fuente: Oficina del senador Sanders
Tekever cierra 580 millones de dólares a una valoración de 6.400 millones
La portuguesa-británica Tekever, fabricante de drones autónomos con IA, anunció el primer cierre de una Serie D de 580 millones de dólares liderada por UC Investments y Baillie Gifford. Acumula más de 50.000 horas de vuelo operativo en Ucrania desde 2022 y acaba de ser elegida por el Ministerio de Defensa británico para el programa CORVUS, de hasta 400 millones de libras en diez años.
Por qué importa: la mayor ronda europea de IA aplicada de la semana es de defensa, con sede en Lisboa y capital universitario estadounidense. Europa sí produce campeones de IA; lo hace donde hay demanda pública sostenida y un cliente que paga.
Fuente: Tekever
SPRIND y NADI lanzan un reto de 40 millones de euros para diseñar chips con agentes de IA
La agencia alemana SPRIND y la neerlandesa NADI lanzaron el AI-Native Chip Design Challenge: 40 millones de euros en dos fases a lo largo de 20 meses para equipos que usen agentes y aprendizaje por refuerzo para reducir el diseño de chips de años a semanas. La fase 1 (noviembre de 2026 a julio de 2027) financia a siete equipos con 2,6 millones cada uno; la fase 2 selecciona a tres con 7 millones cada uno.
Por qué importa: es soberanía tecnológica con presupuesto concreto, y el modelo SPRIND empieza a replicarse entre países. Para pymes y startups europeas de hardware, es una de las pocas vías de financiación pública con calendario definido.
Fuente: Tech.eu