Un desarrollador de la comunidad ajustó el modelo MiniCPM5-1B de OpenBMB usando trazas de razonamiento generadas por Claude Fable 5, la familia de modelos de Anthropic. El resultado es un modelo de mil millones de parámetros que funciona por completo en la máquina del usuario, sin conexión a la nube, y cuya versión más liviana ocupa apenas 657 megabytes. El proyecto, publicado en Hugging Face por el usuario GnLOLot, muestra hasta dónde llega hoy la moda de los modelos pequeños que «piensan en voz alta».
La idea de fondo es sencilla. En lugar de entrenar un modelo desde cero, se toma uno ya existente y se le aplica un ajuste fino (fine-tuning): un reentrenamiento sobre ejemplos específicos para que imite un comportamiento deseado. En este caso, esos ejemplos fueron trazas de razonamiento —el paso a paso con el que un modelo grande descompone un problema antes de responder— tomadas de Claude. La intención era transferir ese estilo de «pensamiento visible» a un modelo mucho más chico.
Qué hereda un ajuste fino y qué no
Aquí conviene separar el marketing de la realidad técnica. Un ajuste fino sobre trazas de otro modelo copia la forma de razonar, no la capacidad del modelo original. El MiniCPM5-1B resultante aprende a exponer una cadena de pasos parecida a la de Claude, pero sigue siendo un modelo de mil millones de parámetros: su conocimiento, su precisión y su límite de errores son los de un modelo pequeño, no los de un sistema de frontera.
Esa distinción importa porque el razonamiento en pasos no equivale a razonamiento correcto. Un modelo compacto puede mostrar una secuencia ordenada y llegar igualmente a una conclusión equivocada. La técnica de aprender del comportamiento de un modelo más grande se conoce como destilación, un enfoque que laboratorios como Thinking Machines vienen documentando para trasladar habilidades a redes más eficientes.
Las cifras del proyecto
El modelo se ofrece en formato GGUF, el estándar que permite ejecutar modelos en equipos domésticos con herramientas como Ollama. Estos son los datos verificables según las fichas publicadas:
- 1.000 millones de parámetros, heredados de la base MiniCPM5-1B de OpenBMB.
- Versión más liviana de 657 MB, gracias a la compresión (cuantización) que reduce la precisión numérica del modelo.
- Ventana de contexto de 128.000 tokens, es decir, la cantidad de texto que puede tener en cuenta a la vez.
- Razonamiento visible: el modelo muestra sus pasos intermedios antes de dar la respuesta final.
Correr un modelo de este tamaño en local tiene ventajas concretas: no hay costos por uso, los datos no salen del dispositivo y funciona sin internet. Es la misma lógica que impulsa otros esfuerzos por meter modelos de razonamiento en hardware modesto, como los proyectos que buscan que un modelo de razonamiento quepa en un teléfono.
El punto legal que queda abierto
El proyecto arrastra una duda que la propia ficha del modelo no resuelve: la licencia. Entrenar un modelo con salidas generadas por Claude entra en un terreno gris, porque los términos de uso de varios proveedores comerciales restringen emplear las respuestas de sus sistemas para entrenar modelos que compitan con ellos. La ficha en Hugging Face no aclara bajo qué condiciones se distribuyen esas trazas ni qué licencia aplica al modelo derivado.
Para quien quiera entender mejor de dónde vienen esas trazas de razonamiento, vale conocer cómo funciona Claude, el modelo de Anthropic usado como fuente.
Más allá del caso puntual, el experimento refleja una tendencia clara de la comunidad de código abierto: aprovechar modelos base ligeros y las salidas de sistemas grandes para producir versiones especializadas en cuestión de días. La eficiencia crece rápido; las reglas sobre qué se puede usar para entrenar, mucho más despacio.
