Moonshot AI lanza Kimi K3, un modelo multimodal abierto de 2.8 billones de parámetros con razonamiento agente nativo

0
El Prompt1visualizaciones

Kimi K3 es un modelo multimodal nativo con capacidades agentivas y pesos abiertos, el más capaz de Moonshot AI hasta la fecha. Cuenta con 2.8 billones de parámetros totales (104 mil millones activados), una ventana de contexto de un millón de tokens y visión nativa. Es el primer modelo abierto de la clase 3T, diseñado para tareas de codificación de largo alcance, trabajo de conocimiento y razonamiento.

Arquitectura y eficiencia

Utiliza la atención Kimi Delta Attention (KDA) y Attention Residuals (AttnRes), junto con una mezcla de expertos (MoE) escalada mediante Stable LatentMoE. De 896 expertos disponibles, activa 16 por token, lo que proporciona una mejora de eficiencia de escalado de aproximadamente 2.5× respecto a Kimi K2. El modelo incluye 93 capas (69 KDA + 24 Gated MLA), un codificador de visión MoonViT-V2 de 401M parámetros y cuantización nativa MXFP4.

Resultados destacados en evaluaciones

En benchmarks de razonamiento y conocimiento, Kimi K3 alcanza un 93.5% en GPQA Diamond y un 74.7% en AA-LCR. En codificación, obtiene 67.5 en DeepSWE, 88.3 en Terminal-Bench 2.1 y 81.2 en FrontierSWE. Para tareas agentivas, consigue 91.2 en BrowseComp y 84.8 en OSWorld-Verified. En visión, logra 91.1 en OmniDocBench y 90.0 en Video-MME (con subtítulos).

Capacidades agentivas y multimodales

Kimi K3 puede mantener sesiones largas de ingeniería con mínima supervisión humana, navegar repositorios masivos y orquestar herramientas de terminal (desde optimización de kernels GPU hasta diseño de chips). También realiza investigación profunda con visualizaciones interactivas, dashboards y edición de video, gracias a su arquitectura multimodal nativa que integra texto, imágenes y video dentro del mismo modelo.

Despliegue y uso

El modelo está disponible a través de la API en platform.kimi.ai, compatible con OpenAI/Anthropic. Se recomienda ejecutarlo con motores como vLLM, SGLang o TokenSpeed. Siempre tiene el pensamiento habilitado (requiere devolver reasoning_content en conversaciones multiturno) y funciona óptimamente con el marco agente Kimi Code CLI. Los pesos completos se publican bajo la licencia Kimi K3.

Fuente: huggingface.co · Visto en r/InteligenciArtificial

0 comentarios