EnglishРусский Map

SWE-1.7 - модель для написания кода от Cognition

title
SWE-1.7 - модель для написания кода от Cognition
type
summary
summary
SWE-1.7 от Cognition, обученная через RL на базе Kimi K2.7, близка к GPT-5.5 в тестах кода, а лучший результат показывает на собственном FrontierCode
tags
llm, coding-agent, benchmarks, reinforcement-learning
created
2026-07-18
updated
2026-09-14
lang
ru
translation_of
swe-1-7
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

SWE-1.7 - модель для написания кода от Cognition (компании, создавшей Devin и поглотившей Windsurf), анонсированная 2026-07-18. Её дообучили с помощью RL на базе Kimi K2.7 - открытой модели под лицензией MIT, которая сама уже прошла масштабное post-training обучение через RL; следующее поколение того же семейства, kimi-k3, вышло с открытыми весами 2026-07-27. rl-finetune-beats-frontier относит SWE-1.7 к более широкому классу обученных через RL специализированных моделей, которые обходят frontier-модели с обычным промптингом на узких задачах. Cognition преподносит её с точки зрения соотношения цены и качества: модель, достигающая результатов почти на уровне передовых систем при меньших затратах, чем у GPT-5.5 или Opus 4.8. Она работает только внутри Devin (Web, Desktop, CLI) и хостится на Cerebras со скоростью 1000 токенов/сек. Веса не опубликованы, а API для использования в других средах отсутствует.

Что заявляется

Cognition приводит результаты на трёх агентных бенчмарках для кода. На FrontierCode 1.1 Main - собственном бенчмарке Cognition - SWE-1.7 набирает 42.3%, что чуть ниже 43.0% у GPT-5.5 и ниже 46.5% у Opus 4.8, но заметно выше базовой Kimi K2.7 Code с её 30.1%. На Terminal-Bench 2.1 она показывает 81.5% против 84.2% у GPT-5.5 и 86.9% у Opus 4.8. На SWE-Bench Multilingual модель набирает 77.8%, немного опережая GPT-5.5 с 76.8%, но уступая Opus 4.8 с 84.4%. Таким образом, формулировка "интеллект почти на уровне GPT-5.5 / Opus" на первых двух тестах читается как близко, но ниже, а единственный бенчмарк, где SWE-1.7 слегка обошла GPT-5.5, - это мультиязычный срез SWE-Bench, а не собственный лидерборд Cognition, где она отстаёт.

Второе громкое утверждение касается метода обучения. Поскольку SWE-1.7 получена из Kimi K2.7, которая уже прошла стадию post-training, и всё равно значительно прибавила благодаря собственному RL от Cognition, в компании утверждают, что это ставит под сомнение концепцию "потолка post-training" - идею о том, что возможности модели нельзя продвинуть дальше того, что дало исходное дообучение.

Как, по их словам, её обучали

Большая часть публикации посвящена инфраструктуре и методам RL, а не самой модели. Выделяются четыре момента.

Сохранение энтропии. Длительные прогоны RL склонны к коллапсу - модель перестаёт исследовать пространство решений, и награда выходит на плато. Cognition использует top-p sampling, чтобы токены с низкой вероятностью (обостряющие распределение и уничтожающие энтропию) не попадали в цель оптимизации, в сочетании с sampling distribution replay: благодаря этому модуль обучения производит перенормировку по тому же отобранному подмножеству, из которого семплировался rollout, ограничивая расхождение между обучением и инференсом. Побочный эффект заключается в том, что токены выше порога получают нулевой градиент, что, как утверждается, фокусирует обучение на токенах, несущих полезный сигнал. Также упоминаются оптимизатор Muon и устранение недетерминированных операций в обучающем коде.

Обучение на нескольких кластерах. RL отлично распределяется по кластерам, поскольку единый высокоскоростной кластер требуется только компоненту обучения; движкам инференса нужны лишь актуальные веса. Обучение шло в четырёх дата-центрах на трёх континентах (собственные GPU плюс провайдеры вроде Fireworks). Вместо передачи полных весов обучающий узел отправляет сжатые дельты весов через облачное объектное хранилище (объём передачи уменьшается более чем на 99%), а движки инференса заранее их скачивают и применяют на месте. Межконтинентальные обновления для модели на 1T параметров, как сообщается, занимают 1-2 минуты с паузой инференса всего на 3-4 секунды. Отказоустойчивость опирается на NVIDIA Dynamo для перенаправления инференса и локальное сохранение чекпоинтов на каждом шаге с репликацией между узлами для модуля обучения.

Качество данных. Контроль качества валидаторов для снижения ложноположительных и ложноотрицательных срабатываний, фильтрация по сложности (сохраняются задачи, которые модель решает лишь изредка - именно там есть сигнал для обучения) и меры против читерства: песочницы с ограниченным доступом к сети и очищенной историей git, изолированный контур оценки, проверка сигнатур эксплойтов и нулевая награда за любую попытку сжульничать, независимо от её успеха.

Самоупаковка (self-compaction). Когда прогон приближается к лимиту контекста, модель суммаризирует собственное рабочее состояние и продолжает работу уже с этого резюме. Благодаря этому rollout'ы выходят за пределы исходного контекстного окна - вплоть до шести часов в прогонах SWE-1.7. Чередующийся штраф за длину переключается между фазами оптимизации только на успешность и фазами со штрафами за превышение бюджета токенов, шагов или времени; в итоге простые задачи ужимаются, а сложные сохраняют способность к длинным цепочкам действий. Впервые Cognition опробовала self-compaction в более ранней работе над ядром Kevin-32B.

Особенности поведения

По утверждению Cognition, поведение SWE-1.7 заметно отличается от базовой Kimi в двух аспектах: более сжатый chain-of-thought (меньше служебных слов, примерно вдвое меньше слов на предложение, что объясняется фазами с ограничением бюджета) и гораздо более глубокое исследование кодовой базы перед началом действий - больше вызовов инструментов, чтения файлов и поиска. При исправлении багов модель чаще ищет первопричину, проверяет крайние случаи и некорректные входные данные, а неоднозначную семантику разрешает написанием небольших скриптов, а не догадками. Заявленный компромисс - разрастание скоупа (scope creep): она пишет лишние тесты и затрагивает больше файлов, чем требует задача, что Cognition называет общей для индустрии тенденцией по мере роста рассуждающих способностей моделей.

Нюансы

Самый сильный результат показан на собственном бенчмарке Cognition, и даже там SWE-1.7 уступает GPT-5.5 и Opus 4.8. Terminal-Bench 2.1 запускался во внутреннем тестовом фреймворке Cognition (Claude Code для моделей Anthropic, Codex для OpenAI, Devin CLI для остальных). SWE-Bench Multilingual объединяет заявленные конкурентами цифры с собственными прогонами Cognition в Devin CLI. Все результаты получены от самого разработчика, а независимо протестировать модель вне Devin невозможно, так как нет ни открытых весов, ни API.

Здесь проявляется та же проблема scaffold-model-fit, только с другой стороны: бенчмарк измеряет модель вместе с обвязкой Devin, к которой она намертво привязана, а не модель саму по себе. Если в little-coder-scaffold-model-fit показано, как результат одной и той же модели скачет при смене скаффолда, то SWE-1.7 обучалась внутри собственного скаффолда и поставляется только внутри него, поэтому разделить их невозможно. Общее предостережение относительно сравнения моделей по единственному числу применимо и здесь: см. structured-output-benchmark о том, как отдельная ось бенчмарка (JSON-Pass против Value-Accuracy) может приукрасить показатели модели, и incompressible-knowledge-probes - о попытке измерить ёмкость закрытой модели, не полагаясь на собственные оценки вендора.

Интересное из обсуждений

Самую меткую мысль на HN высказал комментатор, заметивший, что график цена/качество у SWE-1.7 почти в точности повторяет график, опубликованный Cursor для Composer 2.5, - с той лишь разницей, что на каждом из них лучшей оказывается модель собственного создателя. Обе модели дообучены через RL на базе Kimi, а их обучающие данные и бенчмарки, вероятно, происходят из источников одного типа (логи взаимодействия Devin и Cursor), так что обе, вполне вероятно, переобучены под собственные тесты. Комментатор счёл это оверфиттингом, а не умышленным обманом. Базирование на Kimi несёт и политические риски: созданный Cursor на основе Kimi Composer 2 стал одной из моделей, привлекших внимание комитета Палаты представителей к материнской компании (us-scrutiny-of-chinese-model-use). Другие высказывались резче: "сделай свой бенчмарк - и ты в нём победишь" и "бенчмарки - это просто субъективные ощущения с погрешностью; разбудите меня, когда она проживёт неделю на реальной кодовой базе и не сгаллюцинирует несуществующий пакет".

Регулярно повторялись две структурные претензии. Во-первых, SWE-1.7 остаётся моделью с закрытыми весами и отсутствует на HuggingFace, несмотря на происхождение от Kimi K2.7 под лицензией MIT, и доступна только внутри окружения Devin без API, из-за чего многие посчитали, что на неё не стоит тратить время. Во-вторых, за Cognition тянется репутационный шлейф из-за их первой демонстрации Devin в 2024 году, которую многие сочли вводящей в заблуждение; комментатор, знакомый с сотрудниками компании, описал реальные продукты и талантливых инженеров наряду с привычкой избегать невыгодных сравнений и полагаться на внутренние бенчмарки, добавив, что прошлые модели Cognition на практике уступали аналогичным Claude и GLM. Более мягкое замечание: указывать цены API конкурентов - странная ось сравнения, учитывая, что большинство пользователей не платит за токены, а по-настоящему примечательной цифрой может оказаться пропускная способность Cerebras.