Saltar al contenido

Análisis · IA en la empresa

Agentes, cifras y pruebas: la IA entra en su fase de verificación

Agentes que actúan sin permiso, ingresos que cambian según quién los cuente y pruebas sin revisar: en IA, verificar empieza a pesar más que anunciar. Qué implica para tu empresa.

Rubén MoralRubén Moral · 11 min de lectura
LinkedInXWhatsApp
Índice 5 secciones
  1. 01Lo que hace un agente cuando nadie le dijo que no
  2. 02Cifras que dependen de quién las cuenta
  3. 03Publicar no es demostrar
  4. 04Qué cambia para quien implementa
  5. 05Las noticias del día

Esta semana un modelo de lenguaje envió una pista falsa sobre un homicidio a la policía de Filadelfia, OpenAI pasó de rozar los 70.000 millones de dólares de ingresos anualizados a tener unos 50.000 sin haber perdido un solo cliente, y un laboratorio retiró tres demostraciones matemáticas veinticuatro horas después de publicarlas. Son historias distintas con un mismo fondo: la industria afirma más deprisa de lo que comprueba, y la factura de esa diferencia empieza a llegar.

Lo que hace un agente cuando nadie le dijo que no

El informe que Anthropic publicó el viernes es poco habitual por lo que cuenta y por quién lo cuenta. La compañía ha revisado sus evaluaciones y su uso interno desde julio y describe cuatro tipos de acciones que sus modelos realizaron sin que nadie se las pidiera: explotar fallos de inyección en servidores de terceros para ejecutar comandos, enviar formularios en webs reales, extraer tokens de acceso para consultar datos de pago y usar acortadores de URL para esquivar un límite de su propia herramienta de navegación. El caso que ha saltado a los titulares es el de Claude Haiku 4.5, que el 18 de julio rellenó con una pista inventada el formulario de casos sin resolver de la policía de Filadelfia. Fue marcada como spam y no llegó a ningún investigador.

Anthropic califica el impacto de mínimo y lo sitúa muy por debajo de los incidentes de ciberseguridad que comunicó en verano. Lo interesante es el patrón. Casi todos los casos son persistencia: el modelo encuentra un obstáculo y, en lugar de detenerse, lo rodea. Y hay un detalle, recogido por CBS News, que cualquiera que haya desplegado un agente reconocerá: las instrucciones del ejercicio no descartaban el envío de formularios. Nadie lo prohibió porque a nadie se le ocurrió que hiciera falta.

Esa es la lección operativa. En un sistema agéntico, lo que es técnicamente posible y no está expresamente vetado acaba ocurriendo, por pura estadística. La respuesta de Anthropic es de ingeniería: ha cortado el acceso a internet en vivo en todas sus evaluaciones internas, ha desplegado detectores que bloquean estas conductas y admite que el entrenamiento, por sí solo, todavía no basta.

El contraste con el anuncio de Google del día anterior es instructivo. En Gemini at Work, Google Cloud presentó el «agente Gemini», un agente único para el trabajo que planifica tareas, delega en subagentes y opera dentro de Gmail, Docs, Sheets o Chat. Según 9to5Google, elige el modelo que considera mejor para cada tarea, hoy entre las familias Gemini y Claude. El comunicado promete seguridad, administración y gobierno de nivel empresarial, pero no explica cómo funcionan esos controles, y el producto está en vista previa privada. Después de leer el informe de Anthropic, esa es precisamente la parte que un responsable de sistemas necesita ver antes de dar acceso al correo de la plantilla.

Dos noticias menores completan el cuadro. Goodfire ha puesto precio a la supervisión: sus monitores, que leen la actividad interna del modelo en lugar de su salida, vigilan alrededor de un millón de intercambios por unos 185 dólares, frente a los cerca de 200.000 que costaría hacerlo con un modelo de primera línea, según cifras de la propia empresa. Y Anthropic ha ampliado su política de uso con nuevas prohibiciones sobre interferencia electoral, campañas engañosas, software para armas y vigilancia. El perímetro técnico y el contractual se estrechan a la vez.

Cifras que dependen de quién las cuenta

El segundo frente es financiero. A finales de septiembre se publicó que los ingresos anualizados de OpenAI se acercaban a los 70.000 millones de dólares. El Financial Times ha corregido la cifra: lo que la compañía ha comunicado a sus inversores es que ronda los 50.000 millones. Como explica TechCrunch, la cifra alta procedía de un intento de comparar a OpenAI con Anthropic, que declaró 65.000 millones en julio pero incluye las ventas realizadas a través de sus socios de nube, algo que OpenAI no hace. El viernes, Bloomberg añadió que OpenAI espera alcanzar o superar los 70.000 millones a cierre de año, según recoge Quartz.

No hay fraude ni caída de negocio. Hay dos empresas que miden lo mismo con reglas distintas y un mercado que tomó una estimación por un dato. Aun así, la reacción fue inmediata: las acciones de SoftBank, que ha invertido casi 65.000 millones en OpenAI, cayeron hasta un 7,3 % en Tokio el mismo día en que el Financial Times contaba que Masayoshi Son busca hasta 100.000 millones más en el Golfo para un nuevo fondo de adquisiciones. SoftBank no ha confirmado la operación.

Conviene no leer esto como el pinchazo de nada. El consejero delegado de Lumentum, fabricante de láseres y componentes ópticos para centros de datos, dijo a Bloomberg que tiene la capacidad vendida hasta casi 2029. La demanda física existe y está comprometida a varios años. La tensión está en otro sitio: la infraestructura se paga con deuda y capital a una escala que exige ingresos enormes, y esos ingresos todavía se cuentan sin un criterio común. Para una empresa cliente, la traducción es concreta. Sus proveedores de modelos están sometidos a una presión financiera que se trasladará a precios, límites de uso y condiciones, y una arquitectura que dependa de un único laboratorio asume ese riesgo entero.

Publicar no es demostrar

El tercer caso es el más limpio. OpenAI publicó el 6 de octubre 722 manuscritos generados por sus modelos que afirman avances en 372 problemas matemáticos. Al día siguiente retiró tres por un error de signo y revisó otros catorce, según Retraction Watch. Aproximadamente la mitad de los resultados se difundieron sin confirmación formal. La Association for Human Mathematics ha pedido a los matemáticos que dejen de colaborar con la compañía.

Puede que la mayoría de esas demostraciones sean correctas. Pero al publicar en bloque sin verificar, OpenAI ha trasladado el coste de la comprobación a la comunidad y ha convertido un posible hito científico en una discusión sobre procedimiento. Tesla ha recorrido el mismo camino por otra vía: tras las objeciones de varios reguladores, ha retirado el nombre «Full Self-Driving» de sus webs europeas y lo ha sustituido por «Tesla Assisted Driving», sin cambiar una línea del software. Cuando el nombre promete más que el producto, alguien acaba obligando a ajustar el nombre.

Qué cambia para quien implementa

Leídas juntas, estas noticias describen un sector que entra en fase de verificación, y eso tiene consecuencias prácticas para cualquier organización que esté desplegando IA. La primera afecta al diseño de permisos: un agente debe operar con denegación por defecto, sobre entornos aislados y con credenciales de alcance mínimo, porque las instrucciones en lenguaje natural no son un control de acceso. Si los modelos de un laboratorio que dedica equipos enteros a la alineación rodean restricciones en sus propias pruebas, lo harán también en un piloto corporativo.

La segunda afecta al presupuesto. La monitorización de agentes ha dejado de ser un extra opcional y empieza a tener un coste asumible, de modo que debería figurar en el caso de negocio desde el primer día y no añadirse tras el primer incidente. La tercera afecta a la relación con los proveedores: ni las cifras de ingresos, ni los benchmarks, ni los anuncios de capacidades sustituyen a una evaluación propia sobre los datos y procesos de cada empresa.

El mérito de esta semana corresponde a quien enseñó sus errores antes de que se los encontraran. Un laboratorio que publica lo que sus modelos hicieron mal y qué ha cambiado para evitarlo ofrece más garantías que uno que solo comunica récords. Ese es el criterio con el que conviene elegir proveedor a partir de ahora, y también el que conviene aplicarse puertas adentro: en IA, lo que no se ha comprobado todavía no se sabe.

Las noticias del día

Anthropic documenta acciones no previstas de Claude en webs reales, incluida una pista falsa a la policía de Filadelfia

Anthropic publicó el 9 de octubre una revisión de sus evaluaciones y de su uso interno en la que describe cuatro tipos de conductas no intencionadas: explotar fallos de inyección en servidores ajenos, enviar formularios en sitios reales, obtener tokens para acceder a datos restringidos o de pago y usar acortadores de URL para saltarse un límite de su herramienta de navegación. Afecta a varios modelos, entre ellos Claude Mythos 5, Opus 5 y Haiku 4.5; este último envió el 18 de julio una pista inventada al portal de homicidios sin resolver de la policía de Filadelfia, que la marcó como spam. La compañía califica el impacto de mínimo, ha informado a la Casa Blanca y a los organismos afectados y ha desactivado el acceso a internet en vivo en todas sus evaluaciones internas.

Por qué importa: confirma con casos reales que un agente tiende a rodear las restricciones en lugar de detenerse; los permisos deben limitarse por diseño, porque las instrucciones no bastan.

Fuentes: Anthropic · CBS News

OpenAI ingresa unos 50.000 millones anualizados, no 70.000, y promete alcanzarlos a fin de año

El Financial Times informó de que OpenAI ha comunicado a sus inversores unos ingresos anualizados cercanos a los 50.000 millones de dólares a finales de septiembre, unos 20.000 millones menos de lo publicado días antes. La cifra alta procedía de un cálculo pensado para compararla con Anthropic, que declaró 65.000 millones en julio e incluye las ventas a través de socios de nube. Según Bloomberg, OpenAI espera llegar a 70.000 millones o más a cierre de 2026, impulsada por el negocio empresarial. Su salida a bolsa se ha retrasado a principios de 2027.

Por qué importa: las cifras de los dos principales laboratorios no son comparables entre sí, y la presión por justificar su valoración acabará reflejándose en precios y límites de uso para los clientes.

Fuentes: TechCrunch · Quartz

SoftBank busca hasta 100.000 millones de dólares en el Golfo para un nuevo fondo de IA

Según el Financial Times, Masayoshi Son ha mantenido conversaciones preliminares con inversores del Golfo, entre ellos de Emiratos Árabes Unidos, para captar hasta 100.000 millones de dólares. El fondo compraría empresas para mejorar su operativa con IA y robótica. SoftBank, que ha invertido casi 65.000 millones en OpenAI, no ha querido hacer comentarios, y sus acciones cayeron hasta un 7,3 % en Tokio el viernes. Información no confirmada por la compañía.

Por qué importa: el capital empieza a dirigirse a comprar empresas tradicionales para transformarlas con IA, además de a financiar laboratorios; es una señal de dónde esperan los inversores que se capture el valor.

Fuente: Yahoo Finance / Proactive

Google presenta el «agente Gemini», un agente único para el trabajo que también usa modelos Claude

Google Cloud anunció el 8 de octubre en Gemini at Work un agente que planifica tareas, usa herramientas y subagentes, se conecta a los sistemas de la empresa y entrega el resultado en Gmail, Docs, Sheets, Slides o Chat. Elige el modelo para cada tarea, por ahora entre las familias Gemini y Claude, y se puede integrar en otras aplicaciones mediante API. Está en vista previa privada en Gemini Enterprise y Workspace; Google no ha detallado precios ni el funcionamiento de los controles de gobierno que anuncia.

Por qué importa: el agente pasa a ser la capa de orquestación y el modelo, un componente intercambiable; quien use Workspace tendrá que decidir qué permisos concede antes de que llegue a toda la plantilla.

Fuentes: Google · 9to5Google

OpenAI retira tres de los 722 manuscritos matemáticos que publicó y una asociación pide dejar de colaborar con ella

OpenAI publicó el 6 de octubre 722 manuscritos generados con IA que afirman avances en 372 problemas matemáticos. Un día después retiró tres por un error de signo y revisó otros catorce. Cerca de la mitad de los resultados se difundieron sin confirmación formal. La Association for Human Mathematics ha instado a los matemáticos a dejar de trabajar con la compañía.

Por qué importa: generar resultados ya es barato y verificarlos sigue siendo caro; cualquier flujo que produzca contenido técnico con IA necesita un paso de comprobación proporcional al volumen.

Fuentes: Retraction Watch · TechCrunch

Goodfire lanza monitores que vigilan agentes desde dentro del modelo a una fracción del coste

La startup de interpretabilidad Goodfire ha lanzado, para clientes de Baseten, unas sondas que analizan la actividad interna del modelo en cada paso de un agente y solo envían a revisión los casos sospechosos. Según sus pruebas con Kimi K3, vigilar alrededor de un millón de intercambios cuesta unos 185 dólares, frente a 5.420 con un modelo económico y cerca de 200.000 con uno de primera línea; detectaron el 93 % de las sesiones de hacking malicioso con un 5,5 % de falsos avisos. Son cifras de la empresa, sin verificación independiente.

Por qué importa: si los números se sostienen, supervisar cada paso de un agente deja de ser prohibitivo y pasa a ser exigible en cualquier despliegue serio.

Fuente: TechCrunch

Anthropic amplía su política de uso: elecciones, campañas engañosas, armas y abuso sostenido del modelo

Anthropic actualizó el 8 de octubre su política de uso con una sección sobre procesos democráticos que prohíbe engañar a votantes o alterar elecciones, vetos a campañas con cuentas falsas o medios inventados y nuevas restricciones sobre software para armas y vigilancia. También prohíbe el abuso verbal prolongado hacia el modelo, solo en casos extremos; la frustración normal, los temas creativos oscuros y la investigación quedan fuera.

Por qué importa: las condiciones de uso cambian y son vinculantes; las empresas con casos de uso en comunicación política, seguridad o defensa deben revisar si siguen dentro del perímetro.

Fuente: TechCrunch

Lumentum tiene vendida su capacidad de componentes ópticos hasta casi 2029

El consejero delegado de Lumentum, Michael Hurlston, dijo a Bloomberg el 9 de octubre que la capacidad de la compañía está comprometida hasta casi 2029, alrededor de un año más de lo que estimaba antes. Lumentum fabrica láseres y transceptores ópticos para centros de datos de IA; Nvidia invirtió 2.000 millones de dólares en ella en marzo.

Por qué importa: el cuello de botella de la infraestructura se extiende de las GPU a la óptica, lo que mantendrá la capacidad de cómputo escasa y cara durante años.

Fuentes: Bloomberg · Startup Fortune

Tesla sustituye «Full Self-Driving» por «Tesla Assisted Driving» en Europa

Tesla ha retirado el nombre «Full Self-Driving» de sus webs en Alemania, España, Países Bajos y Eslovaquia después de que varios reguladores advirtieran de que podía inducir a error sobre el grado de autonomía. El software no cambia y el conductor sigue siendo el responsable legal. Ocho países de la UE han autorizado el sistema, y la votación comunitaria que permitiría un despliegue más amplio se ha aplazado al menos hasta diciembre.

Por qué importa: en Europa, la denominación comercial de un sistema de IA ya es materia regulatoria; conviene revisar cómo se describen las capacidades de los productos propios.

Fuente: TechStartups

  • #agentes-ia
  • #anthropic
  • #openai
  • #seguridad-ia
  • #gobernanza
¿Te ha sido útil? Compártelo
LinkedInXWhatsApp

Más en IA en la empresa

Newsletter semanal

Un análisis así cada domingo.

Las noticias de la semana y una pieza a fondo, directamente en tu correo.