Neutrino-1 8B
- title
- Neutrino-1 8B
- type
- entity
- summary
- 8B под Apache-2.0 от Fermion Research: контейнер на 3,88 ГБ с троичным кодированием для H100, MacBook и CPU
- tags
- llm, open-weights, quantization, local-models, inference
- sources
- neutrino-1-8b
- created
- 2026-07-29
- updated
- 2026-07-29
- lang
- ru
- translation_of
- neutrino-1-8b
- source_updated
- 2026-07-29
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Neutrino-1 8B - флагманская компактная модель от Fermion Research, выпущенная 2026-07-27 под лицензией Apache 2.0. Это плотный decoder-only трансформер на 8,19 млрд параметров, производный от Qwen3-8B от Alibaba Cloud. Вся суть модели - в формате контейнера: все 252 линейных слоя трансформера хранятся в проприетарном формате семейства троичного кодирования с расходом бит в восемь раз меньше, чем у fp16. Веса остаются упакованными побитово при хранении и декодируются прямо внутри матричных ядер. В тракте декодирования веса никогда не материализуются в виде fp16 или fp32.
Главное обещание такого подхода - один-единственный артефакт, работающий на трёх принципиально разных системах: серверном GPU, ноутбуке Apple и десктопном процессоре без какой-либо конвертации под конкретную платформу. Всё приведённое ниже взято со страницы модели от самой Fermion.
Геометрия
Стандартная архитектура Qwen, считываемая из заголовка поставляемого контейнера: 36 слоёв декодера, скрытая размерность 4096, feed-forward SwiGLU с гейтингом на 12 288 с тремя линейными слоями на уровень, grouped-query attention 4:1 (32 головы запросов, 8 голов ключей/значений, ширина головы 128), rotary-эмбеддинги с базой 1 000 000 на всю ширину головы в 128 элементов, RMSNorm с eps 1e-6 плюс поголовочный RMSNorm для query/key внутри механизма внимания, контекст 40 960 токенов, словарь на 151 936 токенов, несвязанные входные и выходные эмбеддинги.
KV-кэш по умолчанию работает в fp32 с расходом 288 КиБ на токен, поэтому 4k контекста требуют 1,21 ГБ, а 32k - 9,66 ГБ при общем весе модели в 3,88 ГБ. На длинном контексте кэш начинает превосходить саму модель по объёму: привычная арифметика kv-cache-sizing бьёт здесь заметнее обычного именно потому, что веса удалось сделать настолько компактными.
Куда ушли байты
Контейнер объёмом 3 875 404 812 байт делится на четыре категории:
| Категория | Доля | Объём |
|---|---|---|
| 252 линейных слоя трансформера (закодированы) | 67.2% | 2605 МБ |
| Два несвязанных тензора эмбеддингов в int8 | 32.1% | 1245 МБ |
| Построчные метаданные (размерности, масштабы, суммы строк) | 0.6% | 25 МБ |
| 145 тензоров нормализации в fp32 | - | 1,2 МБ |
Кодирование применяется только к линейным слоям. Эмбеддинги остаются в int8, поскольку их строки считываются по одному токену за раз, а не перемножаются со всем потоком активаций, а слои нормализации слишком малы, чтобы их имело смысл кодировать. Треть файла занимает словарь - напоминание о том, что при таком масштабе агрессивное сжатие весов упирается в порог, заданный элементами, которые изначально не создавали проблем. Сравните с llm-quantization, где спор о формате и разрядности разворачивается вокруг квантов GGUF.
Fermion публикует статистику заполнения, которая выглядит интереснее сухих цифр размера. Среди 6,95 млрд закодированных весов 62,63% приходятся на нули, а остаток делится на 18,68% положительных и 18,69% отрицательных значений. Баланс знаков выдержан с точностью до сотой доли процента, хотя целевая функция обучения этого никак не требовала. При этом распределение неоднородно по глубине: проекции gate и down в feed-forward-блоках на слоях с 1-го по 3-й показывают всплеск нулей до 70 - 72%, тогда как все четыре проекции внимания удерживают около 62% на любой глубине от 0-го до 35-го слоя. Ранние feed-forward-блоки сбрасывают веса, которые сети не нужны; механизм внимания же сохраняет постоянную плотность кода по всей глубине.
Распространение: один контейнер, три точки входа
Для загрузки предоставляется "кодированный транспортный архив" на 2 559 822 594 байта, который побитово точно разворачивается в контейнер на 3,88 ГБ. Это транспортное кодирование, а не повторное сжатие fp16-модели с потерями.
Движок для pip (pip install fermion-research) скачивает контейнер и нативный бинарник под текущую платформу, включая CPU-рантаймы для macOS arm64 и Linux x86-64 с побитово точной эталонной реализацией на torch внутри. Пакет GGUF работает через собственный форк llama.cpp от Fermion в ветке fermion-fv5, используя тип тензоров FV5. Пакет MLX представляет собой нативный рантайм для экосистемы Apple на Python со специальными ядрами Metal; контейнер мапится в память, а упакованные плоскости декодируются прямо внутри ядер GEMV.
У варианта с GGUF есть существенный нюанс, о котором Fermion говорит прямо: стандартные llama.cpp, Ollama и LM Studio не умеют загружать тип FV5. Требуется их собственный форк, собранный с -DGGML_METAL=OFF для ветки CPU/CUDA или отдельная ветка fermion-fv5-metal для ядер под GPU от Apple. Формула "один артефакт, три точки входа" справедлива для самих весов; рантаймы же представляют собой три отдельные сборки, две из которых разработаны самой Fermion. Тензорные типы от конкретного вендора - обычная история для независимых форков llama.cpp, и последствия здесь те же: кванты работают только там, где поддерживается данный форк.
Интерфейс CLI включает команды chat, serve (локальный OpenAI-совместимый эндпоинт с поддержкой tool calling и стриминга), generate, info (заголовок + проверка SHA-256 по манифесту), bench, inspect (заполненность весов, байты по слоям) и verify (проверка того, что пара драфт/целевая модель выдаёт идентичные токены).
Бенчмарки
Тестирование проводилось на готовом поставляемом контейнере с отключённым режимом рассуждений (thinking), на стандартных открытых стендах, июль 2026 года:
| Бенчмарк | Протокол | Результат |
|---|---|---|
| MMLU | 5-shot, все 57 предметов, 14 042 вопроса | 72.1 |
| MMLU-Redux | генеративный, переразмеченное подмножество | 67.8 |
| IFEval, prompt-strict | генеративный | 77.2 |
| IFEval, instruction-strict | тот же прогон, проверка по отдельным инструкциям | 80.2 |
| IFEval, prompt-loose | тот же прогон, мягкое извлечение ответа | 76.3 |
| BFCL v3 | макро-усреднение по 13 подмножествам | 68.9 |
| GSM8K, гибкое извлечение | 0-shot генеративный, greedy, лимит 256 токенов | 53.4 |
| GSM8K, строгий формат | тот же прогон, ответ засчитывается только в запрошенной форме | 51.73 |
Публикация числа примеров (shot count), режима оценки и количества вопросов в каждой строке встречается нечасто и заслуживает уважения. В частности, пара результатов GSM8K наглядно показывает, чего стоит соблюдение формата (падение с 53,4 до 51,73 в рамках одного прогона) - та же закономерность, по которой structured-output-benchmark выявил разрыв в 15 - 30 пунктов между JSON-Pass и Value-Accuracy у передовых моделей.
Скорость и связка драфт/верификатор
Скорость декодирования в один поток для одного и того же артефакта во всех строках:
| Платформа | Скорость |
|---|---|
| H100 80 GB, со спекулятивным драфтом | 763 токена/с |
| H100 80 GB, обычный greedy | 396 токенов/с |
| Apple M5 MacBook (MLX, оптимизировано) | 33,7 токена/с |
| NVIDIA L4, GGUF + CUDA-форк, полный оффлоад | 30,7 токена/с (4,68 ГиБ при 4k) |
| Apple M5, со спекулятивным драфтом MLX | 25,7 токена/с |
| Apple M5, только CPU, 9 потоков | 24,9 токена/с |
Однопоточное декодирование упирается в объём данных, передаваемых на каждый токен, что и служит главным аргументом в пользу этого формата: рабочий набор данных объёмом 3,88 ГБ декодируется со скоростью, недостижимой для 16-гигабайтного артефакта fp16 на той же подсистеме памяти, а сама модель вместе с кэшем помещается в GPU на 8 ГБ или в ноутбук с 16 ГБ памяти.
Схема speculative-decoding объединяет 8B-верификатор с Neutrino-1 0.6B в роли драфта. Поскольку обе модели используют одинаковый формат и работают на одних и тех же бинарниках, драфт загружается прямо в процесс верификатора - без второго развёртывания и без конвертации. Дополнительные 328 МБ поверх 3,88 ГБ основной модели дают накладные расходы по весу всего в 8,46%, а 4k общего контекста требуют 512 КиБ на токен для всей пары (288 КиБ на 8B и 224 КиБ на драфт).
Токен драфта принимается только тогда, когда он совпадает с собственным argmax модели 8B, поэтому выходной поток ничем не отличается от обычного greedy-декодирования; Fermion сообщает о 27 648 токенах подряд без единого расхождения. Таким образом, прирост скорости обусловлен исключительно принятием токенов драфта и приводится для разных категорий промптов относительно базовой скорости 396 токенов/с: подсчёт и списки - 763 токена/с (×1,93), короткие фактические ответы - 613 (×1,55), продолжение текста - 532 (×1,34), диалоговые объяснения - 447 (×1,13), код - 426 (×1,07). На промптах со счётом на каждом шаге принимаются все шесть токенов драфта, что даёт около семи сгенерированных токенов на один прямой проход 8B; на фактологических промптах доля принятых токенов держится на уровне 96,5%. Динамический контроллер подбирает размер драфта под категорию задачи, благодаря чему даже генерация кода опережает базовую скорость.
Та же связка работает и на ноутбуке: на 16-гигабайтном M5 обе модели загружаются в один процесс MLX с лимитом в 6 ГиБ и достигают пикового потребления в 4,3 ГиБ на двоих (из которых 0,53 ГиБ приходятся на драфт). При этом на 6 из 6 промптов генерация токенов пошагово идентична режиму без спекулятивного декодирования, а скорость составляет 25,71 токена/с против 22,00 в обычном режиме при коэффициенте принятия 0,744. Уложить пару драфт/верификатор в бюджет памяти ноутбука - задача, которую обычно крайне трудно решить при раздельном квантовании двух моделей.
Скептический взгляд
Перед нами продуктовая страница компании, и написана она соответственно: все цифры получены самой Fermion на рантаймах от Fermion, а формат кодирования остаётся проприетарным и не описан нигде, кроме отчётов о результатах его работы. Что приятно выделяется - показатели замерены на реальном поставляемом артефакте, а не на исследовательском чекпоинте, ко всем тестам приложены протоколы, а веса, нативные бинарники, пакеты для GGUF и MLX находятся в одном публичном репозитории, исключая рассинхронизацию компонентов. Лицензия Apache 2.0 без запросов доступа и соглашений унаследована от Qwen3-8B; пакет для pip доступен под Apache-2.0, а форк llama.cpp - под лицензией MIT.
Модель на 8B с результатом 72,1 на MMLU не конкурирует с kimi-k3 или другими передовыми флагманами, и Fermion на это не претендует. Это противоположный край того же спектра: там, где deltafin тратит 14,6 секунды на токен ради запуска модели на 2,8 трлн параметров на одном Mac, Neutrino обходится 3,88 ГБ, чтобы сделать готовую к работе компактную модель доступной везде и сразу. Её реальное применение лежит в плоскости, описанной в local-ai-is-not-opus: ограниченные, чётко очерченные локальные задачи, где фиксированная стоимость и локальность данных важнее предельных возможностей модели.