Petals
- title
- Petals
- type
- toolbox
- summary
- Распределённый инференс LLM на GPU добровольцев в стиле BitTorrent: рабочая идея, код не обновляется с 2024 года
- tags
- python, llm, distributed, p2p, inference, watchlist
- language
- Python
- license
- MIT
- created
- 2026-07-29
- updated
- 2026-07-29
- lang
- ru
- translation_of
- petals
- source_updated
- 2026-07-29
- translated
- 2026-09-01
- translator
- lllm/antigravity/gemini-3.7-flash-medium
Petals разделяет LLM между незнакомыми друг с другом машинами. Вы загружаете несколько последовательных блоков трансформера на свой GPU, подключаетесь к публичному рою людей, хостящих остальные блоки, и прямой проход (forward pass) переходит от узла к узлу, пока не достигнет выходного слоя. Аналогия с BitTorrent точна в главном: никто не держит файл целиком, раздача даёт право скачивать, а ёмкость роя складывается из того, что подключили его участники. Проект вырос из исследовательской группы BigScience, создавшей BLOOM, и получил обзор на TechCrunch в декабре 2022 года.
Помимо идеи "большая модель на маленьком GPU", преимущество в том, что вы находитесь внутри PyTorch, а не за API. Поскольку ваш процесс держит настоящие блоки трансформера, вы можете запускать произвольные методы дообучения и сэмплирования, выбирать нестандартные пути через модель и читать скрытые состояния (hidden states) - то, чего хостинговый эндпоинт генерации никогда не предоставит.
Читайте лендинг с оглядкой на дату
petals.dev заявляет поддержку Llama 3.1 (до 405B), Mixtral 8x22B, Falcon 40B+ и BLOOM 176B, а также приводит скорость инференса одного запроса (single-batch) до 6 токенов/с для Llama 2 70B и до 4 токенов/с для Falcon 180B. Это линейка моделей и замеры 2023-2024 годов, поданные в настоящем времени на странице без единой даты.
Репозиторий это подтверждает. Последний коммит сделан 2024-08-25 ("Upgrade Pydantic to >= 2.0.0"), последний тегированный релиз - v2.2.0 от 2023-09-06, при этом открыто 113 issue. Репозиторий не заархивирован, ссылка на монитор роя health.petals.dev на месте, но по состоянию на июль 2026 года код не менялся примерно два года, так что и цифры пропускной способности, и список моделей стоит воспринимать как исторические. Есть ли ещё хосты в публичном рое - вопрос, на который лендинг не ответит: проверяйте health.petals.dev, а не маркетинговый текст.
Два года - долгий срок для этой сферы. Архитектуры MoE, которые сейчас доминируют среди открытых моделей, задействуют лишь долю параметров на токен (см. mixture-of-experts), что меняет математику, под которую проектировался Petals. Подходы к офлоадингу на одной машине, превзойти которые он пытался, тоже заметно ушли вперёд: deltafin стримит экспертов модели на 2.8T параметров с диска на одном Mac - медленно, но локально. Квантование тоже развивалось (llm-quantization), сокращая круг моделей, которым действительно требуется больше одного потребительского GPU.
На чём идея держится сейчас
Цифры пропускной способности - честная часть описания, и хорошими они никогда не были: 6 токенов/с - это скорость чтения, приемлемая для чат-бота и бесполезная для пакетной обработки. Это тот же потолок, в который упирается Алекс Эллис, рассуждая о локальных моделях вообще, только с обратной стороны: Petals жертвует задержкой и приватностью ради вычислительных мощностей, которыми вы не владеете, тогда как локальный инференс жертвует мощностями ради контролируемой задержки. Ни то, ни другое не заменит подписку на передовые модели, к тому же Petals добавляет проблему доверия, которой нет у локального инференса: ваш промпт и скрытые состояния проходят через чужие GPU, и проект всегда прямо предупреждал, что публичный рой не предназначен для конфиденциальных данных.
Архитектура проекта остаётся самым ясным ответом на вопрос "как выглядел бы инференс LLM на добровольных вычислениях", поэтому он заслуживает отдельной страницы даже в спящем состоянии. Приватный рой на контролируемых вами машинах снимает вопрос доверия, и такому сценарию всё равно, жива ли публичная сеть.
Стоит тег watchlist - см. watchlist. Проверить нужно простое условие: возобновится ли разработка в upstream или репозиторий отправят в архив, и есть ли ещё хосты на health.petals.dev.
MIT, ~10.5k★ на 2026-07-29, 634 форка. Репозиторий не активен, но не заархивирован.