PrismML lanza Bonsai 2 27B: modelo con compresión casi sin pérdida en un espacio 9 veces menor
PrismML presenta Bonsai 2 27B, un modelo multimodal que comprime capacidades de 27 mil millones de parámetros a solo 5.9GB mediante pesos ternarios, reteniendo el 98.2% del rendimiento del modelo original.
PrismML anunció el 17 de septiembre de 2026 el lanzamiento de Ternary Bonsai 2 27B, un modelo multimodal que logra comprimir una arquitectura de 27 mil millones de parámetros en apenas 5.9 gigabytes, más de nueve veces menos que su contraparte en precisión completa. Basado en Qwen3.8 27B, el modelo utiliza una técnica de pesos ternarios —valores de solo −1, 0 y +1 con escalado FP16 por grupos— que reduce cada peso a 1.76 bits efectivos, logrando un equilibrio inédito entre tamaño y rendimiento.
El resultado es un modelo que retiene el 98.2% del desempeño agregado en benchmarks respecto al original de precisión completa, alcanzando una puntuación de 83.9 frente a los 85.4 del Qwen3.8 27B. Esta pérdida marginal se distribuye en áreas críticas como razonamiento, codificación, visión multimodal y llamadas a herramientas, donde el modelo preserva capacidades suficientes para tareas complejas como agentes de código, flujos de trabajo con capturas de pantalla y análisis de documentos privados.
En términos de rendimiento operativo, Bonsai 2 27B alcanza hasta 143 tokens por segundo en una NVIDIA GeForce RTX 5090 y 46.8 tokens por segundo en el M5 Max de Apple. En una RTX 4090, el consumo energético cae a 0.714 mWh por token, un 40% más eficiente que un modelo de 8 mil millones de parámetros en precisión completa. El modelo soporta una ventana de contexto de 262,000 tokens, entrada de texto e imagen, y está disponible bajo licencia Apache 2.0.
Comparado con el primer Bonsai 27B lanzado en julio de 2026, esta segunda generación cierra la brecha de retención del 95% al 98%, un salto que la compañía califica como "prácticamente sin pérdida" (near-lossless). La mejora abre la puerta a despliegues locales de modelos avanzados en laptops, tabletas y teléfonos, sin sacrificar capacidades que antes requerían servidores en la nube.
PrismML, surgida de un equipo de investigadores de Caltech con respaldo de Khosla Ventures, Cerberus, Google y Samsung, argumenta que los modelos de bajo bit pueden redefinir la economía de la IA: ajustar arquitecturas más grandes en el mismo hardware, servir más usuarios por servidor y permitir sistemas híbridos que decidan dinámicamente qué ejecutar localmente y qué delegar a la nube. La pregunta, señala la empresa, ya no es solo qué tan capaz es un modelo, sino cuánta inteligencia útil puede desplegarse dentro de un presupuesto dado de memoria, cómputo y energía.
PrismML lanzó un modelo de inteligencia artificial llamado Bonsai 2 27B que tiene 27 mil millones de parámetros (los "ajustes internos" que le dan su inteligencia). Lo notable es que usando una técnica llamada "pesos ternarios" —donde cada valor se representa con solo tres opciones: −1, 0 o +1— lograron comprimir el modelo a 5.9GB, más de nueve veces más pequeño que la versión normal. Pese a esta compresión radical, el modelo conserva el 98.2% de su capacidad original en tareas como razonamiento, programación y análisis de imágenes. Esto significa que ahora puede correr en una laptop o incluso en un teléfono con velocidades altas (hasta 143 tokens por segundo en tarjetas gráficas avanzadas) y consumo energético muy bajo, algo que antes solo era posible con modelos en servidores remotos.
Esta historia fue investigada y redactada por el sistema editorial de NeologIA — agentes especializados con verificación independiente de fuentes — bajo supervisión humana. Cómo trabajamos →