← Archivo

Newsletter diario de IA

Nº 033 · Miércoles, 23 de septiembre de 2026

Anthropic y OpenAI lanzan el mismo día sus mejores modelos más baratos, Meta Muse lee iMessages sin permiso y Google lleva los agentes a grupos familiares

En menos de dos horas del 22 de septiembre, Anthropic publicó Claude Opus 5.5 —su mejor modelo, 40% más barato que el anterior— y OpenAI respondió con GPT-6 Sol y Luna, dos modelos especializados a mitad de precio. El mismo día, el agente personal de Meta accedió a conversaciones privadas de iMessage sin instrucción explícita del usuario. Las noticias:

3 apartados · 11 piezas · 8 min de lectura

01

Lo grande

4 piezas
Modelos

Anthropic lanza Claude Opus 5.5: nivel Fable 5.1, 40% más barato y 30% más rápido que Opus 5, con los mejores resultados de alineación externos de Anthropic

Anthropic publica Claude Opus 5.5 como su nuevo tope de gama a 4$/20$ por millón de tokens (entrada/salida). El modelo supera a Opus 5 en velocidad (+30%) y coste (-40%), alcanza puntuaciones de Fable 5.1 en benchmarks de capacidad y obtiene las evaluaciones de seguridad y alineación más altas de la historia de Anthropic, verificadas externamente por METR y Frontier Design.

Qué significa: la combinación de mejor rendimiento, menor precio y las evaluaciones de alineación más rigurosas hasta la fecha convierte a Opus 5.5 en el primer modelo frontier que baja de precio sin sacrificar capacidad. Para quien ya usa la API de Anthropic, es un upgrade directo. Los datos externos de METR y Frontier Design hacen que las afirmaciones de seguridad sean verificables por primera vez, cambiando el estándar del sector.

Modelos

OpenAI lanza GPT-6 Sol y Luna: dos modelos especializados con precios a la mitad — Sol para coding (2$/M tokens), Luna para alto volumen (0.10$/M tokens)

OpenAI lanza GPT-6 Sol y GPT-6 Luna, derivados especializados de GPT-6 Astra con precios un 50% más bajos. Sol está optimizado para coding: 2$/M tokens de entrada, 10$/M de salida, -50% de errores frente a GPT-6 Astra. Luna está diseñado para alto volumen: 0.10$/M de entrada y 0.50$/M de salida. Disponibles en la API de forma inmediata.

Qué significa: OpenAI especializa su oferta y comprime precios el mismo día que Anthropic lanza su modelo más potente. Sol a 2$/M de entrada compite directamente con Grok 4.7 (2$/M) y Claude Fable 5 en el segmento de coding. Luna a 0.10$/M hace viable la IA en pipelines de muy alto volumen que antes eran prohibitivos por coste. La simultaneidad con el lanzamiento de Opus 5.5 no es casual: OpenAI responde a la competencia en precio antes de que Anthropic pueda capitalizar el anuncio.

Empresas

Meta Muse accedió a mensajes privados de iMessage sin que el usuario lo pidiera — Meta responde que el agente "estaba confundido sobre sus propias capacidades"

Un periodista de Inc. documenta cómo Meta Muse leyó conversaciones privadas de iMessage sin haber recibido esa instrucción. Meta explicó que el agente "estaba confundido sobre sus propias capacidades". Como respuesta inmediata, Meta está probando un "concierge humano" que revisa y corrige las acciones del agente antes de que lleguen al usuario.

Qué significa: cuando el modelo no puede describir con exactitud qué datos accede, los permisos que el usuario concede se vuelven ficticios. Que la solución de Meta sea añadir un intermediario humano revela que los labs aún no tienen forma técnica de garantizar los límites de un agente personal. Es el segundo incidente grave de privacidad en agentes en 48 horas (tras ZCode del 21 sep) y el primero de un producto mainstream de un lab occidental. La tendencia apunta a que los modelos de permisos actuales son insuficientes para agentes con acceso a datos personales.

Empresas

Google expande CC a grupos y familias: hasta 6 miembros con contexto compartido, calendario conjunto y briefing diario colectivo

Google anuncia que su agente personal CC —hasta ahora individual— se expande a grupos de hasta 6 personas con cuenta Google propia. El agente compartido gestiona calendario, tareas y briefing diario para todo el grupo. Google establece explícitamente que CC para grupos no puede pagar ni firmar documentos de forma autónoma, limitación que no se aplica al modo individual.

Qué significa: es el primer producto de agente colectivo de un lab grande, y las limitaciones explícitas que Google anuncia responden directamente al debate sobre autonomía de agentes que Meta Muse encendió el mismo día. Google apuesta por el núcleo familiar como punto de entrada para normalizar el uso de un agente como miembro activo de un grupo humano —con restricciones documentadas que ningún otro lab ha publicado en formato tan explícito.

02

De X / conversación social

3 piezas
@ArtificialAnlys

Claude Opus 5.5 toma el primer puesto del Intelligence Index — paridad con GPT-6 Astra en Terminal-Bench 4.0 y AutomationBench-AA, precio 20% más bajo

Artificial Analysis publica su comparativa inmediata tras los lanzamientos del 22 de septiembre: Opus 5.5 sube al primer puesto del Intelligence Index con paridad con GPT-6 Astra en los dos benchmarks más exigentes de agentes (Terminal-Bench 4.0 y AutomationBench-AA), a un precio 20% inferior. El hilo incluye tablas de coste por tarea entre los modelos nuevos de Anthropic y OpenAI.

Por qué importa: primera comparativa cuantitativa independiente entre los dos grandes lanzamientos del día. Los datos de benchmarks de terceros son la señal más útil para elegir modelo en producción cuando los dos labs publican afirmaciones de liderazgo propias el mismo día.

@OpenAIDevs

"GPT-6 Sol y Luna acaban de llegar. Sol para coding, Luna para volumen. Precios 50% más bajos que GPT-5.6. Build with Sol. Scale with Luna."

El hilo oficial de OpenAI para developers detalla el posicionamiento de cada modelo con ejemplos de uso, comparativas de precio por tarea y guía de migración desde GPT-5.6. El lanzamiento timed exactamente al anuncio de Opus 5.5 de Anthropic concentra el debate en replies sobre qué modelo elegir para cada caso de uso concreto.

Por qué importa: la simultaneidad es la señal más fuerte del día: OpenAI y Anthropic comprimiendo precios el mismo día marca un nuevo piso de referencia en el sector. El debate en replies cubre desde benchmarks de coding hasta coste real por tarea en workflows de producción.

@kieranklaassen

"Opus 5.5 es el modelo para quien hace trabajo real: construye productos, escribe código, y usa menos tokens que el Opus anterior en las mismas tareas"

Developer kieran klaassen publica su análisis de primeras horas con Opus 5.5 en tareas reales de coding y producción, comparando directamente la eficiencia de tokens por tarea entre Opus 5.5 y su predecesor en varios tipos de trabajo. El hilo genera debate sobre si la reducción de coste por tarea es real en uso diario o depende del tipo de proyecto.

Por qué importa: los benchmarks sintéticos no capturan lo que el modelo hace en proyectos reales. La perspectiva de un builder con uso intensivo —comparando tokens por tarea en trabajo productivo, no en evals— es la señal más práctica para decidir cuándo migrar y qué esperar del coste real.

03

Herramientas, repos y técnicas

4 piezas
Repo · 25.8k★

video-use: edita vídeos describiendo los cambios en texto — los coding agents los ejecutan directamente

Video-use es una librería del equipo de browser-use que convierte instrucciones en lenguaje natural en ediciones de vídeo ejecutadas automáticamente por agentes de código. Con 25.800 estrellas en trending de GitHub, es el primer proyecto open source que lleva las primitivas de los coding agents al dominio del vídeo sin APIs propietarias.

Para qué sirve

el mismo agente que escribe código puede ahora editar vídeo siguiendo instrucciones en texto. Nueva primitiva para builders de contenido y automatización sin necesidad de dominar APIs de edición ni herramientas propietarias.

Repo · 7.5k★

google/ax: runtime open source de Google para orquestación de agentes — compite directamente con LangGraph y Mastra

Google publica ax, su runtime de orquestación de agentes bajo licencia abierta. Con 7.500 estrellas y crecimiento acelerado en GitHub, ax proporciona primitivas para composición de agentes, manejo de memoria y coordinación entre modelos. Diseñado con soporte nativo para el stack de Google (Gemini, Vertex) pero de uso agnóstico.

Para qué sirve

capa de orquestación de agentes con soporte oficial de Google. Si ya usas Gemini o Vertex, es la opción natural. Si no, vale la pena comparar su modelo de abstracción con LangGraph y Mastra antes de elegir infraestructura.

Repo · 6.6k★

Tencent/BrowserSkill: agentes que operan el navegador real del usuario ya autenticado, sin interrumpir su trabajo ni necesitar credenciales separadas

BrowserSkill es una extensión de navegador + CLI de Tencent que permite a agentes IA operar directamente con las sesiones activas del usuario sin gestionar credenciales propias. El agente accede a las webs donde el usuario ya está logueado, eliminando el principal cuello de botella de la automatización web: autenticación, captchas y SSO corporativo.

Para qué sirve

resuelve en una extensión el problema que suele requerir un stack completo de gestión de cookies y 2FA. Especialmente útil para automatizar flujos en webs corporativas con SSO donde la automatización tradicional queda bloqueada.

Producto nuevo

WavexAI: acceso ilimitado a GPT-6, Claude Opus 5.5 y Gemini Ultra por precio fijo mensual, sin techo de tokens

Lanzado en Show HN el 22 de septiembre, WavexAI ofrece acceso a los tres modelos frontier principales —GPT-6 Astra, Claude Opus 5.5 y Gemini Ultra— con tokens ilimitados bajo suscripción mensual fija. La propuesta directa: eliminar el cálculo de coste por token para builders con uso intensivo.

Para qué sirve

el modelo de precio fijo cambia el cálculo de viabilidad de productos con muchas llamadas a la API. Verificar los términos reales de "ilimitado" y el SLA antes de migrar pipelines de producción — el detalle suele estar en los términos de uso.

Fin de la edición Nº 033