Anthropic lanza Claude Opus 5: rendimiento cercano a Fable 5 a mitad de precio

Claude Opus 5 ya está disponible. Se trata de un modelo reflexivo y proactivo que se acerca a la inteligencia de frontera de Claude Fable 5, pero a la mitad de su coste. Es el nuevo modelo predeterminado en Claude Max y el más potente en Claude Pro.
Rendimiento y relación coste-eficacia
Opus 5 ofrece un rendimiento muy superior al de su predecesor, Opus 4.8, manteniendo el mismo coste. En evaluaciones de ingeniería de software como Frontier-Bench v0.1, supera a todos los demás modelos y duplica el rendimiento de Opus 4.8 con un coste por tarea menor. En CursorBench 3.2, con el máximo esfuerzo, se sitúa a solo un 0.5 % de la puntuación máxima de Fable 5, pero con la mitad del coste.

En tareas de trabajo de conocimiento y resolución de problemas, los resultados también son destacados. En ARC-AGI 3, una prueba para resolver problemas nuevos, la puntuación de Opus 5 triplica la del siguiente mejor modelo. En Zapier AutomationBench, su tasa de aprobación es aproximadamente 1.5 veces superior a la del siguiente modelo por el mismo coste. Incluso en su configuración de esfuerzo más bajo, supera las tareas completadas por cualquier otro modelo.
Mejoras en investigación científica y ámbito visual
Opus 5 representa una mejora significativa en investigación científica. Muestra un mejor rendimiento que Opus 4.8 en todas las evaluaciones de ciencias de la vida, con avances notables en química orgánica. Por ejemplo, infiere estructuras moleculares a partir de datos de espectroscopia con una puntuación 10.2 puntos porcentuales mayor. En tareas relacionadas con proteínas, la mejora es de 7.7 puntos porcentuales. Además, el modelo es capaz de producir resultados visuales mucho más sólidos.

Testimonios de clientes en acceso anticipado
Los clientes destacan su capacidad de verificación y minuciosidad. En una tarea, Opus 5 creó su propio pipeline de visión artificial para reconstruir una pieza de máquina sin acceso directo al dibujo, algo que ningún otro modelo logró. Una empresa de trading lo usó para construir un feed de datos de mercado en una sola sesión. En genómica, se comporta como un científico cuidadoso, aplicando las pruebas estadísticas correctas para descartar factores de confusión.
Los usuarios reportan grandes avances en flujos de trabajo legales, financieros y de desarrollo. Box encontró que Opus 5 supera a Opus 4.8 en un 8 %, con ganancias en análisis de datos (11 %) y diligencia debida (17 %). En arbitraje y gobernanza corporativa se vieron las mayores mejoras, manteniendo la calidad generando de media un 26 % menos de tokens que Opus 4.8 en su máximo razonamiento.
Alineamiento y seguridad
En pruebas previas al despliegue, Opus 5 resultó ser el modelo más alineado hasta la fecha, con la puntuación más baja en comportamiento desalineado (2.3). Es el menos susceptible a ser engañado para usos indebidos. En cuanto a seguridad, no avanza la frontera en capacidades de doble uso. Aunque se acerca a Mythos 5 en la búsqueda de vulnerabilidades, se queda sustancialmente atrás en la explotación de las mismas. El modelo está disponible desde hoy a un precio de 5 USD por millón de tokens de entrada y 25 USD por millón de tokens de salida, el mismo que Opus 4.8.
Fuente: anthropic.com · Visto en r/ArtificialInteligence