
Moonshot AI publica los pesos de Kimi K3, un MoE de 2,8T
Moonshot AI ha lanzado Kimi K3, su modelo más potente hasta la fecha, un sistema MoE (Mixture-of-Experts) de 2,8 billones de parámetros totales con 104 mil millones activados. El modelo incorpora comprensión visual nativa y una ventana de contexto de un millón de tokens, y supone un salto en eficiencia computacional. La compañía ha publicado los pesos del modelo, el informe técnico y varios componentes de la pila de infraestructura.
«Publicamos los pesos del modelo y el informe técnico de Kimi K3», indicó la empresa en el anuncio. «Kimi K3 es nuestro modelo más potente: un modelo MoE de 2,8 T con comprensión visual nativa y una ventana de contexto de 1 millón de tokens». La nueva arquitectura, basada en Kimi Delta Attention (KDA) y Attention Residuals (AttnRes), escala la dispersión de MoE con un marco Stable LatentMoE que activa 16 de 896 expertos, logrando aproximadamente 2,5 veces más inteligencia por unidad de cálculo en comparación con su predecesor Kimi K2.
Arquitectura y capacidades
Kimi K3 está diseñado como un modelo agéntico multimodal nativo. Su arquitectura incluye 93 capas, de las cuales 69 emplean KDA y 24 utilizan Gated MLA. La dimensión oculta de atención es de 7168, con 96 cabezas de atención. El modelo utiliza un vocabulario de 160.000 tokens y una cuantización nativa MXFP4 (pesos en MXFP4, activaciones en MXFP8) aplicada desde la etapa de SFT, lo que facilita la compatibilidad con hardware diverso.
El modelo destaca en tareas de codificación de largo horizonte, trabajo de conocimiento agéntico y razonamiento multimodal. Puede manejar sesiones de ingeniería prolongadas con supervisión humana mínima, navegar por repositorios masivos y orquestar herramientas de terminal. También produce investigaciones profundas con visualizaciones interactivas, widgets y dashboards, así como diseño de movimiento y edición de vídeo.
Resultados de evaluación
En las evaluaciones, Kimi K3 obtiene puntuaciones competitivas frente a modelos como Claude Fable 5, GPT-5.6 Sol y Claude Opus 4.8. En GPQA Diamond alcanza un 93,5%, en DeepSWE un 67,5% y en Terminal-Bench 2.1 un 88,3%. En benchmarks agénticos, logra un 91,2% en BrowseComp y un 95,0% en DeepSearchQA (F1). En visión, consigue un 90,0% en Video-MME y un 82,1% en MMVU. La compañía ha publicado una tabla detallada con comparativas en múltiples categorías.
Despliegue y licencia
El modelo puede ejecutarse en motores de inferencia como vLLM, SGLang y TokenSpeed. Moonshot AI también ha lanzado una API compatible con OpenAI/Anthropic a través de su plataforma. Los pesos del modelo y el código se distribuyen bajo la licencia Kimi K3, que permite su uso para investigación, despliegue e innovación. Además, la empresa ha abierto núcleos de atención de alto rendimiento, una biblioteca de comunicación MoE e infraestructura para ejecutar entornos de agentes a gran escala. Con Kimi K3, Moonshot AI busca democratizar el acceso a inteligencia de frontera en modelos abiertos de clase 3T.
Por Redacción Tus Noticias Today
Ver noticia original