Unsloth
- title
- Unsloth
- type
- entity
- summary
- Команда квантования, создавшая семейство UD-Q*-XL GGUF и схему Dynamic 2.0; популярный издатель динамических квантов для Qwen/Gemma/DeepSeek
- tags
- llm, quantization, local-models
- created
- 2026-05-13
- updated
- 2026-05-13
- lang
- ru
- translation_of
- unsloth
- source_updated
- 2026-05-13
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Unsloth - команда разработчиков инструментов для обучения и квантования LLM, наиболее известная в сообществе локальных LLM линейкой GGUF-сборок UD-...-XL и лежащей в её основе схемой Unsloth Dynamic 2.0. Их сборки обычно скачивают по умолчанию при выходе новых моделей с открытыми весами: huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF, huggingface.co/unsloth/gemma-4-... и так далее.
Что делает Dynamic 2.0
Два отличия от стандартной сборки GGUF:
-
Большой калибровочный датасет для imatrix. Перед квантованием через модель прогоняют от 300K до 1.5M токенов реальных диалогов, измеряя чувствительность каждого слоя. Чувствительные к квантованию слои остаются в 8 или 16 битах, остальные можно ужать до 4 бит и ниже без непропорциональной потери качества.
-
Суффикс XL сохраняет attention с точностью, близкой к исходной. Если стандартные K-кванты сжимают attn и ffn вместе с простым масштабированием K-блоков, то рецепт XL от Unsloth квантует тензоры attention заметно менее агрессивно (ближе к Q8), перекладывая основную экономию размера на ffn.
Изначально по рецепту UD собирался только вариант XL; в свежих релизах версии UD выходят для каждого уровня квантования.
Результат на Qwen 3.6 35B-A3B (KLD относительно BF16)
Из замеров Вячеслава в habr-local-llm-quantization-deep-dive:
- Классический Q4_K_M ≈ UD-Q3_K_XL - динамический квант Q3 на 4.4 ГБ меньше при примерно том же KLD.
- UD-Q4_K_XL превосходит Q4_K_M, при этом весит на 1.2 ГБ больше.
- UD-Q2_K_XL превосходит IQ2_M при том же объёме в байтах и пригоден для серьёзных задач - успешно с первой попытки сгенерировал процедурный клон Minecraft на 4060 16 ГБ.
Такова картина по KLD относительно BF16. Отдельный замер в более ранней статье тесты на Хабре показал у UD-Q4_K_XL на Qwen MoE перплексию на WikiText-2 хуже, чем у Q4_K_M (деградация +9.7% против +2.1%). Две метрики дают противоположные выводы на одном и том же сравнении. KLD относительно базового BF16 - более свежий замер, учитывающий специфику архитектуры; сами Unsloth позже убрали слои MXFP4 из GGUF для Qwen из-за сообщений о вычислительных аномалиях, так что некоторые их ранние сборки Qwen действительно уступали каноническому Q4_K_M.
Другие создатели динамических квантов
Согласно habr-local-llm-quantization-deep-dive, Unsloth - один из четырёх заметных авторов динамических квантов, у каждого из которых свой рецепт:
| Издатель | Характерный выбор | Сильная сторона |
|---|---|---|
| Unsloth (UD-...-XL) | Attn близко к оригиналу, динамический ffn | Максимальный охват новейших моделей |
| Ubergarm (IQ4_KS) | IQK-кванты для ik_llama, динамические | Максимальное качество при том же размере на ik_llama |
| Bartowski | Свой imatrix под стандартными именами | Стабилен на разных архитектурах; imatrix с упором на английский |
| mradermacher (i1-) | imatrix, настроенный под мультиязычность | Лучше поддержка языков кроме английского |
Все четверо теперь используют imatrix даже для "статических" K-квантов. Стандартный рецепт (по умолчанию в ggml, ollama, LM Studio) остался в прошлом.
Ссылки
- llm-quantization - обзорная страница; UD-Q*-XL является одной из ветвей
- habr-local-llm-quantization-deep-dive - разбор от Вячеслава с эмпирическим сравнением KLD
- local-llm-16gb-vram-tests - более ранний замер по перплексии (другая метрика, другой вывод)
- llama-cpp - GGUF от Unsloth ориентированы на форматы квантования llama.cpp
- mixture-of-experts - архитектура, на которой поведение Dynamic 2.0 наиболее вариативно