Исследовательская лаборатория Prism-ML представила Bonsai 27B — семейство сверхлегких бинарных (1-битных) и троичных квантованных сборок большой языковой модели Qwen 3.6 27B. Проект нацелен на радикальное снижение требований к оперативной памяти и вычислительной мощности при локальном развертывании нейросетей.
Главным достижением Bonsai 27B является возможность запуска тяжелой модели с 27 миллиардами параметров на обычных потребительских ноутбуках и даже современных смартфонах. Благодаря экстремальному квантованию размер модели в памяти удалось уменьшить до минимальных значений, сохранив при этом около 94% от исходного качества работы базовой версии Qwen 3.6 27B.
В ходе практического тестирования разработчики сравнили производительность Bonsai 27B на ПК с видеокартой RTX 5070 Ti (16 ГБ VRAM). Бинарная версия модели легко умещается в видеопамять вместе с большим контекстным кэшем. При этом наблюдается интересная особенность: из-за сильного сжатия весов модель генерирует более подробные цепочки рассуждений (Chain of Thought), многократно перепроверяя выводы, но в итоге выдает корректный результат. По общей скорости и точности Bonsai 27B показывает результаты на уровне качественных 4-битных моделей меньшего размера (таких как Gemma 4 12B QAT).
Для пользователей высокопроизводительных серверов на базе графических ускорителей NVIDIA DGX Spark или GB10 использование Bonsai 27B также имеет смысл, если требуется запустить локального ИИ-помощника параллельно с другими тяжелыми вычислительными задачами, не занимая все доступные ресурсы видеопамяти.
Сборки Bonsai 27B в формате GGUF уже опубликованы для свободного скачивания и тестирования. Для запуска рекомендуется использовать специализированные сборки llama.cpp с поддержкой алгоритмов Prism-ML.
Источники
- Hugging Face (коллекция Bonsai 27B), 2026-07-15
- NVIDIA Developer Forums, 2026-07-18
