blackdark
HerramientasKimi K2.5Moonshot AImodelo open sourceIA agénticacódigo abiertomodelos de IA

Kimi K2.5 de Moonshot AI: el modelo open source que pelea de tú a tú con los grandes (2026)

Qué es Kimi K2.5 de Moonshot AI, el modelo open source 1T MoE multimodal y agéntico: puntos fuertes, cómo usarlo (web, API, OpenRouter, local), licencia, coste y cómo se compara con DeepSeek, Qwen y Llama.

Por BlackdarkActualizado el 9 min de lectura

Durante años, "modelo open source" fue sinónimo de "casi tan bueno como el de pago, pero no del todo". Te servía para trastear, para no depender de OpenAI, para correr algo en local sin que nadie viera tus datos. Pero cuando la tarea apretaba de verdad, volvías a GPT o a Claude. Esa frontera lleva un par de años desdibujándose, y Kimi K2.5 es uno de los modelos que la han empujado más lejos.

Lo ha hecho Moonshot AI, una empresa china que se ha convertido en sinónimo de "abierto pero serio". Y la propuesta es directa: un modelo que puedes descargar, abrir en canal, ajustar y desplegar donde quieras, pero que en agentes, código y multimodalidad no tiene complejo de pelearse con los cerrados. Vamos a verlo sin humo.

Nota

Esta guía es informativa y refleja datos públicos a junio de 2026. Las cifras de precio y los benchmarks pueden cambiar entre versiones; verifica siempre en las fuentes oficiales (kimi.com, platform.moonshot.ai y el repositorio de Moonshot) antes de tomar decisiones de coste o producción.

Qué es Kimi K2.5 y por qué importa

Kimi K2.5 es el modelo open source insignia de Moonshot AI, lanzado a finales de enero de 2026 como evolución directa de Kimi K2. Sobre el papel es un asistente de IA más, pero los detalles de su construcción son lo que lo hacen interesante.

Por dentro usa una arquitectura Mixture-of-Experts (MoE): en lugar de un solo bloque gigante que se activa entero en cada respuesta, el modelo tiene 1 billón de parámetros totales repartidos en 384 expertos, y en cada token solo enciende 8 de ellos más uno compartido. ¿La consecuencia? Solo 32.000 millones de parámetros activos por petición. Tienes el "saber" de un modelo enorme con el coste de cómputo de uno mucho más pequeño. Esa es la jugada técnica que permite que un modelo de frontera sea, además, ejecutable.

Lo segundo que lo separa del pelotón es que es nativo multimodal: no le han pegado la visión después con celo. Se entrenó sobre una mezcla de texto, imagen y vídeo desde la base (con un codificador visual propio, MoonViT, de 400M de parámetros), así que entiende una captura de pantalla, un diseño de UI o un vídeo corto y los convierte en código o en análisis sin intermediarios.

Y lo tercero, lo que de verdad marca época: es agéntico de serie. No es un chatbot al que le añades herramientas con pegamento; está diseñado para razonar en varios pasos, llamar a herramientas, y —su rasgo estrella— coordinar un enjambre de subagentes trabajando en paralelo. Volveremos a eso.

Importa porque junta tres cosas que antes pedías por separado: abierto (lo controlas tú), multimodal (ve y lee) y agéntico (hace, no solo responde). Y lo hace a nivel de los grandes cerrados.

Puntos fuertes: dónde brilla de verdad

No todo modelo abierto vale para lo mismo. Estos son los terrenos donde Kimi K2.5 saca pecho.

  • Contexto largo (256K tokens). Le metes una base de código entera, un contrato de 200 páginas o una conversación kilométrica y mantiene el hilo. En la práctica, 256K tokens son cientos de miles de palabras sin perder el contexto a mitad de tarea.
  • Capacidad agéntica y Agent Swarm. Aquí está su carta más fuerte. Kimi K2.5 puede autodirigir hasta 100 subagentes en paralelo, cada uno usando herramientas por su cuenta para buscar, generar, analizar y organizar información. Para flujos largos —investigación a gran escala, redacción extensa, descargas por lotes— Moonshot reporta reducciones de tiempo de hasta 4,5×. En sus benchmarks agénticos rinde de forma notable (por ejemplo, ~74,9% en BrowseComp).
  • Código de primer nivel. En SWE-bench Verified —el termómetro estándar para resolver bugs reales de repositorios— marca 76,8% en modo Thinking. Y va más allá del texto: convierte diseños visuales (mockups de UI, capturas) en código front-end funcional con buena fidelidad.
  • Razonamiento y matemáticas. En modo Thinking firma cifras altas en pruebas duras: 96,1% en AIME 2025 (matemáticas de competición) y 87,6% en GPQA-Diamond (preguntas de ciencia a nivel experto).
  • Visión y vídeo de verdad. Al ser multimodal nativo, entiende vídeo (87,4% en VideoMME) y documentos visuales (Word, Excel, PDF) sin trucos externos.

Consejo

Truco mental para elegir modo: usa Instant para tareas rápidas y baratas, Thinking cuando el problema requiere razonar (código difícil, mates, análisis), Agent cuando hay que usar herramientas, y reserva Agent Swarm para trabajos grandes y paralelizables donde el tiempo importe más que el coste.

Cómo usarlo: cuatro caminos según tu nivel

Una de las gracias de Kimi K2.5 es que no te obliga a una sola puerta de entrada. Tienes desde "cero fricción" hasta "control total".

1. La web (kimi.com) — para probar en 30 segundos. Entras a kimi.com, creas cuenta y chateas. Hay también app móvil. Eliges entre los modos Instant, Thinking, Agent y Agent Swarm (beta) según lo que necesites. Es la forma de hacerte una idea sin tocar una línea de código.

2. La API oficial — para integrarlo en tu producto. Moonshot ofrece su API en platform.moonshot.ai, y el detalle importante para quien programa es que es compatible con OpenAI. Eso significa que migrar un proyecto que ya usaba la librería de OpenAI es casi cambiar la URL base y la clave.

Llamada con la API (compatible con OpenAI, Python)
from openai import OpenAI

client = OpenAI(
  api_key="TU_CLAVE_MOONSHOT",
  base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
  model="kimi-k2.5",
  messages=[
      {"role": "system", "content": "Eres un asistente útil y directo."},
      {"role": "user", "content": "Explica en 3 frases qué es una arquitectura MoE."},
  ],
)

print(resp.choices[0].message.content)

3. Vía OpenRouter — para no atarte a un proveedor. Si ya trabajas con OpenRouter, tienes Kimi K2.5 disponible con el identificador moonshotai/kimi-k2.5. Útil para comparar modelos lado a lado o tener fallback sin cambiar de SDK.

4. En local — para control y privacidad totales. Como los pesos son abiertos (en Hugging Face, organización moonshotai), puedes desplegarlo tú mismo con motores de inferencia como vLLM, SGLang o KTransformers. Es la opción para quien quiere datos 100% en casa o fine-tuning a medida. El pero: un modelo de 1T parámetros, aunque solo active 32B, no cabe en un portátil: necesitas varias GPUs de gama alta. Para correr cosas más modestas en tu equipo, mejor mira Ollama.

Bonus para programadores: Kimi Code CLI. Moonshot tiene su propio agente de código, Kimi Code, que funciona desde la terminal y se integra con editores como VSCode, Cursor y Zed. Es el marco pensado para exprimir las capacidades agénticas del modelo en tu flujo de desarrollo real.

Licencia y coste: la letra pequeña

La parte que hace que todo lo anterior sea "open source de verdad": tanto el código como los pesos se publican bajo una Licencia MIT Modificada. En esencia es muy permisiva —puedes usarlo, modificarlo y desplegarlo, incluso comercialmente—, con algunas condiciones añadidas típicas de estos lanzamientos (atribución a gran escala). Léela antes de montar un producto encima, pero es de las licencias más amistosas que vas a encontrar en un modelo de este calibre.

En coste, hay que separar las vías:

  • Web: gratis para probar.
  • API: de lo más barato del mercado para su nivel. En OpenRouter ronda los 0,50 $ por millón de tokens de entrada y 2,80 $ por millón de salida (la cifra baila según proveedor, y con caché de prompt puede caer un 60–80%). Comparado con los modelos cerrados de frontera, es una fracción.
  • Local: "gratis" en licencia, pero el coste se traslada al hardware. Varias GPUs serias no son baratas ni de comprar ni de alquilar. Solo compensa si tienes volumen muy alto o requisitos de privacidad estrictos.

Nota

Regla práctica de coste: para experimentar y para la mayoría de proyectos, la API (directa o vía OpenRouter) es lo más sensato. El despliegue local solo gana cuando el volumen es brutal o cuando los datos no pueden salir de tu infraestructura por norma legal.

Kimi K2.5 frente a otros open source

El terreno de los modelos abiertos está caliente, y Kimi no juega solo. Una comparación honesta, sin coronar a nadie como "el mejor" porque depende de para qué:

  • vs DeepSeek. DeepSeek (también MoE, con menos parámetros totales) es el rey del precio y un razonador muy sólido. Si tu prioridad absoluta es el coste por token y trabajas sobre todo con texto, DeepSeek es competidor directo. Kimi gana en multimodalidad nativa (visión, vídeo) y en el paradigma agéntico de enjambre.
  • vs Qwen (Alibaba). Qwen tiene la familia más amplia —desde modelos diminutos hasta enormes— y brilla en multilingüismo y en flexibilidad de tamaños. Si necesitas un modelo pequeño para edge o el mejor soporte en muchos idiomas, mira Qwen. Kimi tiende a ganar en benchmarks agénticos y de matemáticas, aunque las versiones más nuevas de Qwen aprietan fuerte en código.
  • vs Llama (Meta). Llama tiene el ecosistema y la comunidad más grandes: herramientas, tutoriales, fine-tunes para todo. Si valoras el respaldo de la comunidad y la madurez del tooling, es difícil de batir. Kimi apuesta por el techo de capacidad y la multimodalidad de fábrica frente a la ubicuidad.

El resumen: DeepSeek por precio, Qwen por variedad e idiomas, Llama por ecosistema, Kimi por ser el paquete abierto más completo en agentes + visión + código de primer nivel. No hay un ganador universal; hay un ganador por necesidad.

A favor

  • Open source de verdad (licencia MIT Modificada, pesos en Hugging Face): lo controlas, lo ajustas y lo despliegas tú.
  • Multimodal nativo: texto, imagen y vídeo entrenados desde la base, no añadidos a posteriori.
  • Agéntico de primer nivel con Agent Swarm: hasta 100 subagentes en paralelo y grandes ahorros de tiempo.
  • Fuerte en código y razonamiento (76,8% en SWE-bench Verified, cifras altas en matemáticas).
  • Por API es de los modelos de frontera más baratos, y la API es compatible con OpenAI.

En contra

  • Correrlo en local exige varias GPUs de gama alta: el 'gratis' de los pesos se traslada al hardware.
  • Para texto puro y sin más, DeepSeek puede salir aún más barato.
  • El ecosistema y la comunidad son menores que los de Llama.
  • El ritmo de versiones es vertiginoso: lo que pruebas hoy puede quedar atrás en meses.
  • Como todo modelo de origen chino, conviene revisar políticas y cumplimiento si manejas datos regulados.

¿Para quién es Kimi K2.5?

No es un modelo "para todo el mundo" en el sentido de masas; es un modelo para quien sabe lo que quiere de un modelo abierto.

Te interesa si: desarrollas productos sobre IA y quieres una alternativa abierta a GPT/Claude sin renunciar a calidad; construyes flujos agénticos (investigación automatizada, pipelines de datos, agentes de código) y el Agent Swarm te ahorra horas; trabajas con contenido visual (UI a código, análisis de vídeo/documentos) y quieres multimodalidad nativa; o necesitas privacidad y control y puedes permitirte el hardware para correrlo local.

No te interesa (todavía) si: solo quieres chatear de forma casual —para eso te sobra con la web de cualquier asistente—; tu prioridad es el precio absoluto sobre texto puro y DeepSeek te cubre; o necesitas un modelo pequeño para correr en un portátil o en el edge, donde Qwen o un modelo vía Ollama encajan mejor.

La pregunta honesta no es "¿es Kimi K2.5 el mejor modelo del mundo?". Es "¿necesito un modelo abierto que vea, razone y actúe a nivel de los grandes, y estoy dispuesto a elegir la vía (web, API o local) que encaje con mi caso?". Si la respuesta es sí, Kimi K2.5 es, ahora mismo, una de las apuestas más sólidas del campo abierto. Y que un modelo descargable pelee de tú a tú con los cerrados es, en sí mismo, una buena noticia para todos.

FAQ

Kimi K2.5 es un modelo de IA open source desarrollado por la empresa china Moonshot AI, lanzado en enero de 2026. Usa una arquitectura Mixture-of-Experts (MoE) de 1 billón de parámetros totales con solo 32.000 millones activos por petición, es nativo multimodal (entiende texto, imagen y vídeo) y está pensado para tareas agénticas y de programación con una ventana de contexto de 256K tokens.

Sí. Tanto el código del repositorio como los pesos del modelo se publican bajo una Licencia MIT Modificada, y los pesos están disponibles en Hugging Face bajo la organización moonshotai. Puedes descargarlo, inspeccionarlo, ajustarlo (fine-tuning) y desplegarlo en tu propia infraestructura.

La vía más rápida es la web kimi.com (también hay app móvil): creas cuenta y chateas eligiendo el modo Instant, Thinking, Agent o Agent Swarm. Si quieres integrarlo en tu código, tienes la API oficial en platform.moonshot.ai —compatible con OpenAI— o puedes enrutarlo a través de OpenRouter con el identificador moonshotai/kimi-k2.5.

Probarlo en la web es gratis. Por API es de los modelos de frontera más baratos: en OpenRouter ronda los 0,50 $ por millón de tokens de entrada y 2,80 $ por millón de salida (varía según proveedor y con caché de prompt baja bastante). Descargarlo es gratis, pero ejecutarlo localmente requiere varias GPUs de gama alta, así que el coste se va al hardware.

Depende de la tarea. Kimi K2.5 destaca en benchmarks agénticos y de código (76,8% en SWE-bench Verified) y aporta visión y vídeo nativos. DeepSeek suele ganar en precio, Qwen ofrece más tamaños de modelo y mejor multilingüismo, y Llama tiene el ecosistema más grande. Kimi gana cuando necesitas un modelo abierto, multimodal y agéntico de primer nivel en un solo paquete.

Sigue profundizando en el mismo tema.

Compartir
Newsletter

Recibe las próximas guías en tu correo

Ideas y recursos de IA y marketing, sin relleno. Lo que funciona y cómo aplicarlo.

Ideas y recursos sin spam. Cancela cuando quieras.

¿Te sirve esta guía?

Suscríbete