EnglishРусский Map

Unsloth

title
Unsloth
type
entity
summary
Команда квантования, создавшая семейство UD-Q*-XL GGUF и схему Dynamic 2.0; популярный издатель динамических квантов для Qwen/Gemma/DeepSeek
tags
llm, quantization, local-models
created
2026-05-13
updated
2026-05-13
lang
ru
translation_of
unsloth
source_updated
2026-05-13
translated
2026-09-01
translator
lllm/antigravity/gemini-3.7-flash-medium

Unsloth - команда разработчиков инструментов для обучения и квантования LLM, наиболее известная в сообществе локальных LLM линейкой GGUF-сборок UD-...-XL и лежащей в её основе схемой Unsloth Dynamic 2.0. Их сборки обычно скачивают по умолчанию при выходе новых моделей с открытыми весами: huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF, huggingface.co/unsloth/gemma-4-... и так далее.

Что делает Dynamic 2.0

Два отличия от стандартной сборки GGUF:

  1. Большой калибровочный датасет для imatrix. Перед квантованием через модель прогоняют от 300K до 1.5M токенов реальных диалогов, измеряя чувствительность каждого слоя. Чувствительные к квантованию слои остаются в 8 или 16 битах, остальные можно ужать до 4 бит и ниже без непропорциональной потери качества.

  2. Суффикс XL сохраняет attention с точностью, близкой к исходной. Если стандартные K-кванты сжимают attn и ffn вместе с простым масштабированием K-блоков, то рецепт XL от Unsloth квантует тензоры attention заметно менее агрессивно (ближе к Q8), перекладывая основную экономию размера на ffn.

Изначально по рецепту UD собирался только вариант XL; в свежих релизах версии UD выходят для каждого уровня квантования.

Результат на Qwen 3.6 35B-A3B (KLD относительно BF16)

Из замеров Вячеслава в habr-local-llm-quantization-deep-dive:

  • Классический Q4_K_M ≈ UD-Q3_K_XL - динамический квант Q3 на 4.4 ГБ меньше при примерно том же KLD.
  • UD-Q4_K_XL превосходит Q4_K_M, при этом весит на 1.2 ГБ больше.
  • UD-Q2_K_XL превосходит IQ2_M при том же объёме в байтах и пригоден для серьёзных задач - успешно с первой попытки сгенерировал процедурный клон Minecraft на 4060 16 ГБ.

Такова картина по KLD относительно BF16. Отдельный замер в более ранней статье тесты на Хабре показал у UD-Q4_K_XL на Qwen MoE перплексию на WikiText-2 хуже, чем у Q4_K_M (деградация +9.7% против +2.1%). Две метрики дают противоположные выводы на одном и том же сравнении. KLD относительно базового BF16 - более свежий замер, учитывающий специфику архитектуры; сами Unsloth позже убрали слои MXFP4 из GGUF для Qwen из-за сообщений о вычислительных аномалиях, так что некоторые их ранние сборки Qwen действительно уступали каноническому Q4_K_M.

Другие создатели динамических квантов

Согласно habr-local-llm-quantization-deep-dive, Unsloth - один из четырёх заметных авторов динамических квантов, у каждого из которых свой рецепт:

Издатель Характерный выбор Сильная сторона
Unsloth (UD-...-XL) Attn близко к оригиналу, динамический ffn Максимальный охват новейших моделей
Ubergarm (IQ4_KS) IQK-кванты для ik_llama, динамические Максимальное качество при том же размере на ik_llama
Bartowski Свой imatrix под стандартными именами Стабилен на разных архитектурах; imatrix с упором на английский
mradermacher (i1-) imatrix, настроенный под мультиязычность Лучше поддержка языков кроме английского

Все четверо теперь используют imatrix даже для "статических" K-квантов. Стандартный рецепт (по умолчанию в ggml, ollama, LM Studio) остался в прошлом.

Ссылки

  • llm-quantization - обзорная страница; UD-Q*-XL является одной из ветвей
  • habr-local-llm-quantization-deep-dive - разбор от Вячеслава с эмпирическим сравнением KLD
  • local-llm-16gb-vram-tests - более ранний замер по перплексии (другая метрика, другой вывод)
  • llama-cpp - GGUF от Unsloth ориентированы на форматы квантования llama.cpp
  • mixture-of-experts - архитектура, на которой поведение Dynamic 2.0 наиболее вариативно