EnglishРусский Map

Neutrino-1 8B

title
Neutrino-1 8B
type
entity
summary
8B под Apache-2.0 от Fermion Research: контейнер на 3,88 ГБ с троичным кодированием для H100, MacBook и CPU
tags
llm, open-weights, quantization, local-models, inference
created
2026-07-29
updated
2026-07-29
lang
ru
translation_of
neutrino-1-8b
source_updated
2026-07-29
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Neutrino-1 8B - флагманская компактная модель от Fermion Research, выпущенная 2026-07-27 под лицензией Apache 2.0. Это плотный decoder-only трансформер на 8,19 млрд параметров, производный от Qwen3-8B от Alibaba Cloud. Вся суть модели - в формате контейнера: все 252 линейных слоя трансформера хранятся в проприетарном формате семейства троичного кодирования с расходом бит в восемь раз меньше, чем у fp16. Веса остаются упакованными побитово при хранении и декодируются прямо внутри матричных ядер. В тракте декодирования веса никогда не материализуются в виде fp16 или fp32.

Главное обещание такого подхода - один-единственный артефакт, работающий на трёх принципиально разных системах: серверном GPU, ноутбуке Apple и десктопном процессоре без какой-либо конвертации под конкретную платформу. Всё приведённое ниже взято со страницы модели от самой Fermion.

Геометрия

Стандартная архитектура Qwen, считываемая из заголовка поставляемого контейнера: 36 слоёв декодера, скрытая размерность 4096, feed-forward SwiGLU с гейтингом на 12 288 с тремя линейными слоями на уровень, grouped-query attention 4:1 (32 головы запросов, 8 голов ключей/значений, ширина головы 128), rotary-эмбеддинги с базой 1 000 000 на всю ширину головы в 128 элементов, RMSNorm с eps 1e-6 плюс поголовочный RMSNorm для query/key внутри механизма внимания, контекст 40 960 токенов, словарь на 151 936 токенов, несвязанные входные и выходные эмбеддинги.

KV-кэш по умолчанию работает в fp32 с расходом 288 КиБ на токен, поэтому 4k контекста требуют 1,21 ГБ, а 32k - 9,66 ГБ при общем весе модели в 3,88 ГБ. На длинном контексте кэш начинает превосходить саму модель по объёму: привычная арифметика kv-cache-sizing бьёт здесь заметнее обычного именно потому, что веса удалось сделать настолько компактными.

Куда ушли байты

Контейнер объёмом 3 875 404 812 байт делится на четыре категории:

Категория Доля Объём
252 линейных слоя трансформера (закодированы) 67.2% 2605 МБ
Два несвязанных тензора эмбеддингов в int8 32.1% 1245 МБ
Построчные метаданные (размерности, масштабы, суммы строк) 0.6% 25 МБ
145 тензоров нормализации в fp32 - 1,2 МБ

Кодирование применяется только к линейным слоям. Эмбеддинги остаются в int8, поскольку их строки считываются по одному токену за раз, а не перемножаются со всем потоком активаций, а слои нормализации слишком малы, чтобы их имело смысл кодировать. Треть файла занимает словарь - напоминание о том, что при таком масштабе агрессивное сжатие весов упирается в порог, заданный элементами, которые изначально не создавали проблем. Сравните с llm-quantization, где спор о формате и разрядности разворачивается вокруг квантов GGUF.

Fermion публикует статистику заполнения, которая выглядит интереснее сухих цифр размера. Среди 6,95 млрд закодированных весов 62,63% приходятся на нули, а остаток делится на 18,68% положительных и 18,69% отрицательных значений. Баланс знаков выдержан с точностью до сотой доли процента, хотя целевая функция обучения этого никак не требовала. При этом распределение неоднородно по глубине: проекции gate и down в feed-forward-блоках на слоях с 1-го по 3-й показывают всплеск нулей до 70 - 72%, тогда как все четыре проекции внимания удерживают около 62% на любой глубине от 0-го до 35-го слоя. Ранние feed-forward-блоки сбрасывают веса, которые сети не нужны; механизм внимания же сохраняет постоянную плотность кода по всей глубине.

Распространение: один контейнер, три точки входа

Для загрузки предоставляется "кодированный транспортный архив" на 2 559 822 594 байта, который побитово точно разворачивается в контейнер на 3,88 ГБ. Это транспортное кодирование, а не повторное сжатие fp16-модели с потерями.

Движок для pip (pip install fermion-research) скачивает контейнер и нативный бинарник под текущую платформу, включая CPU-рантаймы для macOS arm64 и Linux x86-64 с побитово точной эталонной реализацией на torch внутри. Пакет GGUF работает через собственный форк llama.cpp от Fermion в ветке fermion-fv5, используя тип тензоров FV5. Пакет MLX представляет собой нативный рантайм для экосистемы Apple на Python со специальными ядрами Metal; контейнер мапится в память, а упакованные плоскости декодируются прямо внутри ядер GEMV.

У варианта с GGUF есть существенный нюанс, о котором Fermion говорит прямо: стандартные llama.cpp, Ollama и LM Studio не умеют загружать тип FV5. Требуется их собственный форк, собранный с -DGGML_METAL=OFF для ветки CPU/CUDA или отдельная ветка fermion-fv5-metal для ядер под GPU от Apple. Формула "один артефакт, три точки входа" справедлива для самих весов; рантаймы же представляют собой три отдельные сборки, две из которых разработаны самой Fermion. Тензорные типы от конкретного вендора - обычная история для независимых форков llama.cpp, и последствия здесь те же: кванты работают только там, где поддерживается данный форк.

Интерфейс CLI включает команды chat, serve (локальный OpenAI-совместимый эндпоинт с поддержкой tool calling и стриминга), generate, info (заголовок + проверка SHA-256 по манифесту), bench, inspect (заполненность весов, байты по слоям) и verify (проверка того, что пара драфт/целевая модель выдаёт идентичные токены).

Бенчмарки

Тестирование проводилось на готовом поставляемом контейнере с отключённым режимом рассуждений (thinking), на стандартных открытых стендах, июль 2026 года:

Бенчмарк Протокол Результат
MMLU 5-shot, все 57 предметов, 14 042 вопроса 72.1
MMLU-Redux генеративный, переразмеченное подмножество 67.8
IFEval, prompt-strict генеративный 77.2
IFEval, instruction-strict тот же прогон, проверка по отдельным инструкциям 80.2
IFEval, prompt-loose тот же прогон, мягкое извлечение ответа 76.3
BFCL v3 макро-усреднение по 13 подмножествам 68.9
GSM8K, гибкое извлечение 0-shot генеративный, greedy, лимит 256 токенов 53.4
GSM8K, строгий формат тот же прогон, ответ засчитывается только в запрошенной форме 51.73

Публикация числа примеров (shot count), режима оценки и количества вопросов в каждой строке встречается нечасто и заслуживает уважения. В частности, пара результатов GSM8K наглядно показывает, чего стоит соблюдение формата (падение с 53,4 до 51,73 в рамках одного прогона) - та же закономерность, по которой structured-output-benchmark выявил разрыв в 15 - 30 пунктов между JSON-Pass и Value-Accuracy у передовых моделей.

Скорость и связка драфт/верификатор

Скорость декодирования в один поток для одного и того же артефакта во всех строках:

Платформа Скорость
H100 80 GB, со спекулятивным драфтом 763 токена/с
H100 80 GB, обычный greedy 396 токенов/с
Apple M5 MacBook (MLX, оптимизировано) 33,7 токена/с
NVIDIA L4, GGUF + CUDA-форк, полный оффлоад 30,7 токена/с (4,68 ГиБ при 4k)
Apple M5, со спекулятивным драфтом MLX 25,7 токена/с
Apple M5, только CPU, 9 потоков 24,9 токена/с

Однопоточное декодирование упирается в объём данных, передаваемых на каждый токен, что и служит главным аргументом в пользу этого формата: рабочий набор данных объёмом 3,88 ГБ декодируется со скоростью, недостижимой для 16-гигабайтного артефакта fp16 на той же подсистеме памяти, а сама модель вместе с кэшем помещается в GPU на 8 ГБ или в ноутбук с 16 ГБ памяти.

Схема speculative-decoding объединяет 8B-верификатор с Neutrino-1 0.6B в роли драфта. Поскольку обе модели используют одинаковый формат и работают на одних и тех же бинарниках, драфт загружается прямо в процесс верификатора - без второго развёртывания и без конвертации. Дополнительные 328 МБ поверх 3,88 ГБ основной модели дают накладные расходы по весу всего в 8,46%, а 4k общего контекста требуют 512 КиБ на токен для всей пары (288 КиБ на 8B и 224 КиБ на драфт).

Токен драфта принимается только тогда, когда он совпадает с собственным argmax модели 8B, поэтому выходной поток ничем не отличается от обычного greedy-декодирования; Fermion сообщает о 27 648 токенах подряд без единого расхождения. Таким образом, прирост скорости обусловлен исключительно принятием токенов драфта и приводится для разных категорий промптов относительно базовой скорости 396 токенов/с: подсчёт и списки - 763 токена/с (×1,93), короткие фактические ответы - 613 (×1,55), продолжение текста - 532 (×1,34), диалоговые объяснения - 447 (×1,13), код - 426 (×1,07). На промптах со счётом на каждом шаге принимаются все шесть токенов драфта, что даёт около семи сгенерированных токенов на один прямой проход 8B; на фактологических промптах доля принятых токенов держится на уровне 96,5%. Динамический контроллер подбирает размер драфта под категорию задачи, благодаря чему даже генерация кода опережает базовую скорость.

Та же связка работает и на ноутбуке: на 16-гигабайтном M5 обе модели загружаются в один процесс MLX с лимитом в 6 ГиБ и достигают пикового потребления в 4,3 ГиБ на двоих (из которых 0,53 ГиБ приходятся на драфт). При этом на 6 из 6 промптов генерация токенов пошагово идентична режиму без спекулятивного декодирования, а скорость составляет 25,71 токена/с против 22,00 в обычном режиме при коэффициенте принятия 0,744. Уложить пару драфт/верификатор в бюджет памяти ноутбука - задача, которую обычно крайне трудно решить при раздельном квантовании двух моделей.

Скептический взгляд

Перед нами продуктовая страница компании, и написана она соответственно: все цифры получены самой Fermion на рантаймах от Fermion, а формат кодирования остаётся проприетарным и не описан нигде, кроме отчётов о результатах его работы. Что приятно выделяется - показатели замерены на реальном поставляемом артефакте, а не на исследовательском чекпоинте, ко всем тестам приложены протоколы, а веса, нативные бинарники, пакеты для GGUF и MLX находятся в одном публичном репозитории, исключая рассинхронизацию компонентов. Лицензия Apache 2.0 без запросов доступа и соглашений унаследована от Qwen3-8B; пакет для pip доступен под Apache-2.0, а форк llama.cpp - под лицензией MIT.

Модель на 8B с результатом 72,1 на MMLU не конкурирует с kimi-k3 или другими передовыми флагманами, и Fermion на это не претендует. Это противоположный край того же спектра: там, где deltafin тратит 14,6 секунды на токен ради запуска модели на 2,8 трлн параметров на одном Mac, Neutrino обходится 3,88 ГБ, чтобы сделать готовую к работе компактную модель доступной везде и сразу. Её реальное применение лежит в плоскости, описанной в local-ai-is-not-opus: ограниченные, чётко очерченные локальные задачи, где фиксированная стоимость и локальность данных важнее предельных возможностей модели.