Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Bonsai запускает 27B-модель на iPhone с минимальной потерей качества.

Стартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне.

Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели упёрлись в ~2B параметров. Bonsai конвертирует уже готовую предобученную модель, и главный результат именно в этом: считалось, что при сжатии ниже 4 бит модели ломаются сами по себе, но выяснилось, что дело в методах квантования.

Тернарный значит «троичный». Это способ хранения весов, при котором каждый вес принимает только одно из трёх значений: −1, 0 или +1. В обычной модели каждый вес — это число с плавающей точкой (FP16), например 0.0374, и на него уходит 16 бит. В бинарной модели вес может быть только −1 или +1, то есть хранится один бит, по сути только знак. Ноль здесь важен, потому что даёт модели возможность «выключить» связь между нейронами, то есть сказать «этот вход вообще не влияет на выход». Тернарная версия точнее, а бинарная компактнее.

Усредненные показатели по 15 бенчмаркам от математики и кода до вызова инструментов и работы с изображениями показывают, что деградация ответов по сравнению с исходной Qwen3.6-27B составляет 5.4% у Ternary Bonsai — 80.49 против 85.07 и 11.5% у 1-bit Bonsai, которая показала средний балл 76.11. Сравнение проводилось по единой методике на базе EvalScope с vLLM на NVIDIA H100 в режиме рассуждений, где деградация ниже 4 бит проявляется сильнее всего. Тернарная и бинарная версии теряют заметные баллы на агентных задачах и зрении относительно FP16.

Веса обеих версий выложены на Hugging Face, код на GitHub под лицензией Apache 2.0, а попробовать модель можно в браузере.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.