Radar IA para empresas — lunes 7 de septiembre de 2026
· CompaniesAutomation
El 99,9% con el que OpenAI presentó GPT-6 Astra en ARC-AGI-3 salió de un adaptador propio: con el montaje neutral el mismo modelo se queda en 62,7%, y los evaluadores independientes ni siquiera coinciden entre ellos. Meta descuenta un 95% en Muse Spark a quien le deje entrenar con sus prompts y sus respuestas. Fluidstack cierra 1.500 millones de dólares liderados por Jane Street y dobla valoración hasta 18.000 millones sin ser dueña de un solo chip. DeepSeek encarga 160.000 aceleradores Huawei para un centro de un gigavatio en Mongolia Interior. Y el viernes arranca en toda la Unión Europea el reloj de 24 horas para notificar vulnerabilidades explotadas, con multas de hasta 15 millones de euros.
El radar del domingo iba de lo que se puede comprobar; el de hoy va de la letra pequeña. Tres hilos abren la semana. Uno: el 99,9% con el que OpenAI tituló el lanzamiento de su modelo nuevo lo sacó un montaje de pruebas que no vende, y con el estándar neutral el mismo modelo se queda en 62,7%. Dos: la IA barata ya no se paga solo con dinero — Meta descuenta un 95% a quien le regale sus prompts, y DeepSeek encarga 160.000 chips chinos para que la inferencia que le compras corra en Mongolia Interior. Y tres, el viernes arranca en toda la Unión Europea un reloj de veinticuatro horas para notificar vulnerabilidades explotadas, con multas de hasta quince millones de euros. En el dinero, otra ronda de infraestructura: 1.500 millones de dólares para una empresa que no es dueña de un solo chip.
62,7% frente a 99,9%: el número que compras no es el que te enseñaron
OpenAI presentó GPT-6 Astra con un 99,9% en ARC-AGI-3, la prueba de razonamiento general que la industria usa como termómetro de la AGI. La revisión independiente publicada el viernes aclara de dónde sale esa cifra: la consiguió con un adaptador propio que mantiene el estado del razonamiento entre acción y acción, algo que el montaje neutral con el que se miden los modelos rivales no hace. Con ese montaje estándar, Astra se queda en 62,7%. Y los evaluadores independientes ni siquiera coinciden entre ellos: Epoch AI, que agrega más de cincuenta pruebas, lo pone primero con 169 puntos frente a los 163 de Claude Fable 5.1; Artificial Analysis lo deja segundo, 61 contra 66, y también por detrás en su índice de agentes de programación, 67 contra 70. El modelo cuesta además dos veces y media más por unidad de texto que la generación anterior. Para tu empresa: ningún benchmark de fabricante es tu benchmark. Lo que decide si cambias de modelo no es un porcentaje de laboratorio, es tu proceso con tus datos: coge veinte casos reales cerrados de tu operativa —veinte facturas, veinte pedidos, veinte tickets—, escribe la respuesta correcta de cada uno y pásalos por los dos modelos candidatos midiendo aciertos, coste por caso y segundos. Es media jornada de trabajo y es el único número que puedes defender en un comité. Si el vendedor te trae una cifra, pídele la del montaje neutral y el coste por tarea completada, no por token. Fuente.
Meta te descuenta el 95% si le dejas quedarse con tus prompts y tus respuestas
Meta ha abierto una tarifa «contributor» para Muse Spark, su modelo de programación con agentes: el millón de tokens de entrada baja de 1,25 a 0,10 dólares y el de salida de 4,25 a 0,20, un recorte de veintiuna veces en la parte cara. La condición está escrita sin ambigüedad: en esa tarifa, los prompts, las respuestas y los patrones de uso entran en el canal de entrenamiento de los modelos futuros. El motivo es transparente — Facebook, Instagram y WhatsApp le dan a Meta conversación y fotos a espuertas, pero casi nada de lo que necesita un agente de programación para mejorar: sesiones reales de gente arreglando código real. Para tu empresa: esto no se decide con la calculadora, se decide con una política escrita de dos líneas. Divide tu trabajo en dos cajas: lo que puede salir (scripts internos, pruebas, prototipos desechables, automatizaciones de tu propio backoffice) y lo que no puede salir bajo ningún concepto (código de cliente bajo contrato de confidencialidad, cualquier cosa con datos personales, y todo lo que sea tu diferencial). La primera caja se puede llevar a la tarifa barata y ahorrar de verdad; la segunda no, aunque el descuento sea del noventa y cinco por ciento. Y revisa si tus contratos con clientes te permiten siquiera tomar esa decisión: muchos acuerdos de confidencialidad prohíben ceder derivados del código, y el descuento sale caro cuando lo pagas en indemnización. Fuente.
1.500 millones para quien no tiene chips: la valoración se dobla en dos meses
Fluidstack cerró el jueves una ronda de 1.500 millones de dólares liderada por Jane Street que la valora por encima de 18.000 millones. En julio había levantado 750 millones a una valoración de 7.500: ha multiplicado por más de dos en dos meses, y suma ya más de 2.600 millones captados. Lo interesante es el modelo: la compañía no es dueña de los aceleradores, monta y opera clústeres de alto rendimiento para otros, y sus ingresos han pasado de 1,8 millones en 2022 a 66,2 en 2024 y a unos 660 millones proyectados para este año. Detrás está el acuerdo de capacidad a varios años y 50.000 millones que firmó con Anthropic para levantar centros a medida en Texas y Nueva York. El detalle que conviene retener es quién pone el dinero: Jane Street, una firma de trading, lleva comprometidos unos 6.000 millones en CoreWeave y 13.000 en Crusoe. Para tu empresa: el dinero que financia el cómputo que consumes ya no viene de fabricantes ni de operadores de telecomunicaciones, viene de mesas financieras que compran capacidad como quien compra un activo y esperan un retorno con calendario. Eso no es bueno ni malo por sí mismo, pero explica por qué las promociones tienen fecha de caducidad y por qué conviene presupuestar 2027 con la tarifa de lista. Y da una pregunta concreta para la próxima renovación: en qué nube y en qué región se ejecuta realmente tu inferencia, y cuánto preaviso tienes por escrito si cambia el precio. Fuente.
DeepSeek encarga 160.000 chips de Huawei: dónde se ejecuta tu inferencia es una cláusula, no un detalle
DeepSeek prepara el despliegue de al menos 160.000 aceleradores Huawei Ascend 950DT en un centro de datos de aproximadamente un gigavatio en Ulanqab, Mongolia Interior, según adelantó Bloomberg el viernes. Sería el mayor conjunto conocido construido sobre silicio de Huawei, muy por encima de las instalaciones anteriores, que se contaban en decenas de miles de tarjetas. Dos matices importan: el 950DT lo diseñó Huawei para entrenar, pero DeepSeek lo quiere para servir sus modelos ya entrenados, y la escasez de memoria limitará la producción, así que el pedido puede tardar más de un año en completarse — la empresa espera tener parte en marcha a finales de 2027 o principios de 2028. Para tu empresa: muchas pymes españolas han enchufado modelos chinos por precio, directamente o a través de un agregador, sin mirar dónde se ejecuta la llamada. Si esa inferencia acaba corriendo en territorio chino, la conversación deja de ser técnica: pasa a ser una transferencia internacional de datos que el RGPD te obliga a documentar, y a la que se aplica la ley del país donde está la máquina. Dos tareas de esta semana: pide a cada proveedor por escrito la región de ejecución y la política de retención, y ten preparada la alternativa europea del mismo modelo —los pesos abiertos se pueden servir desde la UE— para los procesos que toquen datos personales o secretos comerciales. Fuente.
El viernes empieza el reloj de 24 horas del Reglamento de Ciberresiliencia
El 11 de septiembre entran en vigor las obligaciones de notificación del Cyber Resilience Act europeo. A partir de ese día, cualquier fabricante de un producto con elementos digitales vendido en la Unión debe avisar a ENISA y a su equipo nacional de respuesta a incidentes en veinticuatro horas desde que sabe de una vulnerabilidad explotada activamente o de un incidente grave; la notificación completa va a las setenta y dos horas y el informe final a los catorce días desde que hay parche. Las sanciones llegan a quince millones de euros o el 2,5% de la facturación mundial. Dos avisos prácticos: el plazo cuenta desde que te enteras, no desde que la plataforma única de notificación de ENISA esté funcionando —a finales de agosto todavía no lo estaba y se estrena el mismo día— y «fabricante» incluye a mucha pyme que no se ve así: si vendes un producto con firmware, una app propia o software empaquetado bajo tu marca, lo eres. Para tu empresa: si fabricas, tres cosas antes del viernes: identifica cuál es tu CSIRT de referencia según dónde tengas el establecimiento principal, nombra a una persona con suplente que pueda notificar en veinticuatro horas incluso en agosto, y ten redactada de antemano la plantilla del aviso temprano, porque escribirla con el reloj corriendo es como se pierden las primeras horas. Y si solo compras, prepárate para el otro lado: a partir del viernes vas a recibir avisos de tus proveedores que pueden disparar tus propias obligaciones bajo NIS2, así que decide ya quién los lee y en qué buzón entran. Fuente.
¿Qué mirar esta semana?
Si Anthropic o Google publican su cifra de ARC-AGI-3 con el montaje neutral, que es la única forma de comparar de verdad. Y el viernes, cuántas notificaciones entran de verdad por la plataforma de ENISA en sus primeras horas: será el primer indicio de si el reloj de veinticuatro horas es una obligación real o una casilla más.