This website uses cookies

Read our Privacy policy and Terms of use for more information.

Hola, comunidad de Tomorrow.

Bienvenido a una nueva semana. OpenAI ha lanzado GPT-6 Astra y lo ha vendido a lo grande: dice que es "el principio de la AGI". Pero si apartas el eslogan, lo que de verdad pasó esta semana es otra cosa, más callada y más gorda: la IA se está metiendo en sitios donde un error importa de verdad. Astra ya sabe usar tu ordenador solo. Claude cerró una demostración matemática que ningún humano puede revisar entera a mano. Y ChatGPT se asomó a los historiales médicos.

No es casualidad que vayan juntas. DeepMind afinó la predicción del clima, Microsoft abrió sus millones de chats para defenderse del New York Times, y todo empuja en la misma dirección: la IA deja de ser una voz en una pantalla y empieza a tocar cosas serias —tu salud, la ciberseguridad, la ciencia—. Semana de músculo, con la letra pequeña en la etiqueta de "confía en mí".

En esta edición:

🤖 OpenAI lanza GPT-6 Astra y dice que roza la AGI

📐 Claude cierra el Teorema de Fermat, verificado por ordenador

⚖️ Microsoft abre 8,2M de chats para frenar al New York Times

🌦️ DeepMind estrena WeatherNext 3: clima nuevo cada hora

🩺 ChatGPT entra en tu historial médico

🕒 5 min de lectura

LO MÁS IMPORTANTE

OpenAI presentó GPT-6 Astra, su modelo más potente hasta la fecha. Greg Brockman lo llamó "el principio de la AGI", pero el titular real no es ese: es que Astra sabe manejar un ordenador por su cuenta —navegador, terminal, apps— y que dispara sus capacidades en ciberseguridad. (Ojo: en la edición 04 contamos que un Astra interno resolvía problemas de matemáticas; esto ya es el modelo público, con nombre y disponible.)

Los datos:

  • 100% en ExploitBench —encontrar y explotar fallos de software—, frente al 78,5% de GPT-5.6 Sol.

  • Primer modelo de OpenAI que alcanza el nivel "Crítico" en ciberseguridad de su propio Preparedness Framework.

  • 47% menos de tiempo por tarea manejando el ordenador (test OSWorld) y 99,9% en ARC-AGI-3.

  • Codex corre 1,9× más rápido navegando por webs (Mind2Web).

Por qué te importa: el salto no está en que redacte mejor, está en que actúa. Durante tres años la IA ha vivido dentro de una caja de texto: le escribes, te contesta. Astra sale de ahí y usa el ordenador como lo harías tú, y ese es el mecanismo que lo cambia todo: un modelo que responde te ahorra buscar; un modelo que hace, te quita el trabajo entero de las manos. Aquí está el matiz honesto, y es de los que erizan: ese nivel "Crítico" significa que Astra ya tiene capacidad para ayudar en ciberataques serios, y quien pone la nota y quien hace el examen son la misma empresa. OpenAI dice haberle puesto salvaguardas; es su palabra, tómalo como un aviso, no como una garantía. Lo de "el principio de la AGI" es marketing hasta que se demuestre. Lo de un modelo que actúa solo y roza el techo ofensivo, eso ya es real, y marca hacia dónde va todo: los modelos dejan de contestar y empiezan a hacer.

MÁS NOTICIAS

Anthropic formalizó el Último Teorema de Fermat en Lean —un lenguaje que comprueba cada paso de una demostración— con Claude trabajando casi solo. Es la primera prueba de extremo a extremo verificada por máquina, sin huecos que dependan de fiarse del autor.

Los datos:

  • Claude trabajó de forma mayormente autónoma durante 11 días.

  • Produjo 13 millones de líneas de código Lean.

  • 29.500 teoremas intermedios verificados, de 30.300 generados.

  • Consumió unos 6.000 millones de tokens de salida.

Por qué te importa: una prueba en Lean no pide fe: la máquina revisa cada línea, así que si compila, es correcta. Lo llamativo es el mecanismo detrás —razonamiento encadenado durante 11 días sin perderse—, que es justo el tipo de tarea larga donde los modelos solían descarrilar a la tercera vuelta. El asterisco, y es importante: Claude partía de la demostración humana de Andrew Wiles, no descubrió Fermat de cero; el mérito es formalizarla entera, no resolver el teorema otra vez. Conecta con la destacada: la IA ya aguanta trabajos largos y autónomos, no solo respuestas sueltas.

Microsoft y OpenAI pidieron al juez cerrar la demanda del New York Times destapando cuántas veces Copilot reprodujo de verdad artículos del diario. Su respuesta: casi nunca.

Los datos:

  • De 8,2 millones de registros de chat, 59.545 (menos del 1%) tenían 16 o más palabras en común con textos de prensa.

  • Con libros: solo 24 respuestas reprodujeron 30+ palabras seguidas; de 212 libros, 10 dieron alguna coincidencia.

  • Microsoft sostiene que Copilot no extrae contenido a propósito.

  • El caso se juega en el "uso justo" (fair use) aplicado a la IA.

Por qué te importa: el número parece demoledor, pero aquí está el matiz que casi nadie cuenta: Microsoft no analizó una muestra al azar, escogió los chats con más probabilidad de sacar material protegido, y aun así salió por debajo del 1%. Es su mejor cara del expediente, no una foto neutral. El mecanismo de fondo es lo que está en juego: si un juez compra que reproducir tan poco es fair use, marca la vara para toda la industria sobre cuánto material con derechos puede tragarse un modelo sin pagar. La pelea no es este 1%; es quién define el uso justo en la era de la IA, y esto es el primer asalto con cifras encima de la mesa.

Google DeepMind lanzó WeatherNext 3, su modelo de predicción del clima más preciso, que cambia la simulación física clásica por IA alimentada de datos de satélite.

Los datos:

  • Cinco veces más resolución que WeatherNext 2 (hasta 5 km en superficie).

  • Un pronóstico nuevo cada hora, frente a cada 6 horas de la versión anterior.

  • Hasta un 60% mejor prediciendo lluvia frente a IMERG, y un 30% frente a MRMS.

  • Beneficia sobre todo a Latinoamérica, África y Asia-Pacífico, históricamente peor cubiertas.

Por qué te importa: más resolución y un aviso nuevo cada hora se traducen en algo concreto: más margen para reaccionar ante una tormenta o una inundación, justo en las regiones donde el clima extremo pega más fuerte y los avisos llegaban peor. El mecanismo también importa —cambiar supercomputadoras que simulan la física por un modelo que aprende de satélites lo hace más rápido y mucho más barato de operar—. El asterisco de siempre: los porcentajes de mejora los pone Google, así que conviene esperar a los meteorólogos independientes antes de darlos por buenos. Pero la dirección es clara: la predicción del tiempo se está mudando de la física pura a la IA.

PARA PROBAR ESTA SEMANA

OpenAI conectó ChatGPT a los registros médicos de Epic (con hospitales piloto como UCSF Health) y abrió un plugin de datos públicos de salud: nueve fuentes oficiales como PubMed, ClinicalTrials.gov o DailyMed. La conexión al historial es para organizaciones sanitarias; el plugin de datos públicos sí lo puede instalar cualquiera en EE. UU.

  • Qué lo separa de "pregúntale a ChatGPT por tu dolencia": en vez de responder de memoria —donde se inventa cosas, que en salud es justo lo peligroso—, se apoya en fuentes clínicas oficiales y actualizadas y te las cita. Deja de ser un chatbot opinando y pasa a ser un buscador médico con criterio.

  • El gancho: puedes pedirle que resuma la evidencia real de un tema y que te enseñe de dónde la saca, sin recorrer webs una por una.

Cómo empezar (2 min): desde una cuenta de EE. UU., activa el plugin de datos públicos de salud y pídele algo apoyado en fuente, del tipo: "Resume los ensayos clínicos en fase 3 sobre [tu tema] registrados en ClinicalTrials.gov y cítame cada uno con su enlace." La conexión al historial de Epic va aparte y la gestiona tu centro médico. Aviso honesto: fuera de EE. UU. todavía no está disponible, y esto no sustituye a un médico —es para llegar mejor informado, no para autodiagnosticarte—.

TITULARES RÁPIDOS

  • China propone a EE. UU. una tregua en IA en plena guerra tecnológica.

  • Cuatro grandes modelos de IA se cayeron a la vez: un apagón simultáneo poco habitual que dejó ver cuánto dependemos ya de ellos.

  • OpenAI lanza Daybreak: 1.000 millones de dólares para blindar servicios esenciales frente a ciberataques.

PARA VIGILAR

  • La adopción de Astra en empresas: ¿pesará más el salto de capacidad o el susto del nivel "Crítico"? Yo lo veo con freno: cuanto más capaz es un modelo para atacar, más papeleo de cumplimiento antes de soltarlo en producción.

  • La oleada legal por copyright: con Microsoft enseñando cifras y el Times enfrente, ¿vienen más demandas de medios? Me temo que sí — y ahora todos van a pedir el mismo desglose de chats.

  • La IA en salud de verdad: ¿pasará del piloto con dos hospitales a algo que use tu médico? Diría que va para largo: aquí el freno no es la tecnología, es quién responde por un error clínico.

LA LECTURA DE LA SEMANA

Esta semana todos repiten la misma palabra —"AGI"— y OpenAI la ha soltado a propósito. Pero mira dónde está la chicha de verdad, y no es el eslogan. Astra roza el techo ofensivo en ciberseguridad. Claude aguanta once días de razonamiento sin descarrilar. ChatGPT se asoma a tu historial médico. El patrón no es "la IA es más lista". Es "la IA ya hace cosas serias, sola, en sitios donde un error se paga caro".

Y ahí está el nudo. Cuanto más se mete la IA en lo crítico, más peso tiene quién pone el examen y quién valida el resultado. Y esta semana casi todas las cifras buenas las firma la misma empresa que vende el producto. Mi apuesta: el próximo campo de batalla no va a ser el benchmark, va a ser quién audita el benchmark. Y ahí, de momento, vamos tarde.

Semana de músculo de sobra, con la letra pequeña en la etiqueta de "confía en mí". La IA corre; los contrapesos, más despacio.

¿Tú qué ves en Astra: el arranque de la AGI o una campaña de marketing muy bien montada? Dale a responder y cuéntamelo.

Nos vemos la semana que viene.

— Ángel · Tomorrow

*P.D. ¿Te han reenviado este correo? Suscríbete gratis en thetomorrowai.com y recíbelo cada semana.

Seguir leyendo

Ver más
caret-right