JetBrains, la empresa detrás de entornos de desarrollo como IntelliJ IDEA y PyCharm, presentó Mellum2.1, un modelo de lenguaje abierto diseñado específicamente para tareas de programación. Se distribuye bajo licencia Apache 2.0, lo que permite usarlo, modificarlo e integrarlo en productos comerciales sin pagar regalías.

El modelo tiene 12.000 millones de parámetros en total, pero funciona bajo una arquitectura de mezcla de expertos (mixture of experts o MoE): en lugar de activar toda la red en cada consulta, enruta cada tarea hacia un subconjunto especializado. En la práctica solo se activan unos 2.500 millones de parámetros por operación, lo que reduce el costo de cómputo frente a un modelo denso de tamaño equivalente.

Del 2 al 47 en SWE-bench

El dato más llamativo del anuncio es el salto en rendimiento que logró JetBrains entrenando al modelo con aprendizaje por refuerzo sobre repositorios de código reales. En SWE-bench Verified, una prueba que mide si un sistema puede resolver incidencias de software extraídas de proyectos abiertos de GitHub, Mellum2.1 pasó de una puntuación de 2,0 a 47,0.

Esa diferencia muestra por qué la comunidad presta cada vez más atención al entrenamiento sobre tareas verdaderas y no solo sobre ejemplos de laboratorio. SWE-bench Verified no pregunta por fragmentos aislados de código: evalúa si el modelo entiende el contexto de un proyecto, localiza el error y produce un parche que efectivamente lo corrige. Un salto de esa magnitud sugiere que el ajuste con repositorios reales enseñó al modelo a comportarse menos como un autocompletado y más como un asistente capaz de encadenar pasos.

JetBrains describe a Mellum2.1 como un modelo «pensante», es decir, que genera un razonamiento intermedio antes de entregar su respuesta. Ese enfoque se ha vuelto habitual en los sistemas orientados a tareas complejas, donde razonar paso a paso mejora la tasa de acierto en problemas que requieren varios movimientos encadenados.

Pensado para agentes, no solo para sugerir líneas

El posicionamiento del modelo apunta a los agentes de programación: sistemas que no se limitan a sugerir la siguiente línea mientras alguien escribe, sino que reciben una tarea, exploran el código, proponen cambios y los prueban de forma más autónoma. Es el terreno donde compiten herramientas como las que comparan GitHub Copilot y Cursor, y donde la licencia abierta de Mellum2.1 le da una ventaja concreta.

Que el modelo sea abierto y relativamente ligero importa por una razón práctica: equipos y empresas pueden desplegarlo en su propia infraestructura, ajustarlo a su base de código y mantener el control sobre su información sin depender de una API externa. Para quien trabaja con código sensible o con restricciones de privacidad, esa posibilidad de ejecutar el modelo puertas adentro pesa tanto como la puntuación en un benchmark.

El tamaño también juega a su favor. Un modelo con pocos parámetros activos puede funcionar con menos recursos de hardware, algo relevante para desarrolladores y pequeñas empresas de regiones como Latinoamérica, donde el acceso a GPU de gama alta o a presupuestos de nube abultados no siempre está garantizado. Los modelos abiertos y eficientes bajan esa barrera de entrada.

Una tendencia que se consolida

Mellum2.1 se suma a una corriente de modelos abiertos especializados en programación que buscan hacerle frente a las ofertas cerradas de las grandes compañías. La apuesta de JetBrains es coherente con su negocio: la empresa vive de las herramientas que usan los programadores, y ofrecer un modelo propio, auditable y adaptable refuerza su lugar en el flujo de trabajo del desarrollo de software.

La pregunta que queda abierta es cuánto de ese 47,0 en SWE-bench se traduce en utilidad diaria frente a modelos más grandes y costosos. La respuesta llegará cuando los equipos empiecen a conectarlo a sus propios repositorios y midan si resuelve los problemas que de verdad aparecen en producción.