trueNetLab logo
RU
DeepSeek Harness: Когда действительно всё является плагином

DeepSeek Harness: Когда действительно всё является плагином

Говоря об ИИ-агентах, мы почти всегда начинаем с модели. Какая модель лучше пишет код? Какая понимает более длинный контекст? Какая решает больше задач в бенчмарке? Это понятно, но сегодня такого взгляда уже недостаточно. Агент состоит не только из языковой модели. Ему нужны инструменты, хранилище, сессии, разрешения, среда выполнения, планирование, журналирование и интерфейс, через который человек может вмешаться.

Именно поэтому Developer Preview проекта DeepSeek Harness кажется мне таким интересным. DeepSeek формулирует идею удивительно ясно: Everything is a plugin. Взаимозаменяемыми должны быть не только дополнительные инструменты. Модели, skills, сессии, sandbox-среды, storage, циклы агента, scheduling и даже пользовательский интерфейс тоже рассматриваются как плагины.

На первый взгляд это звучит как техническое проектное решение для разработчиков. Но за ним скрывается более значимое утверждение о следующем этапе развития ИИ. Если интеллект поступает от модели, а практическая способность работать создаётся harness-слоем, эта вторая половина не должна превращаться в непрозрачный блок одного поставщика.

Модель даёт интеллект. Только взаимозаменяемый harness определяет, кому служит этот интеллект и по каким правилам он может действовать.

Агент больше, чем его модель

DeepSeek описывает формулу очень кратко: агент равен модели плюс harness. Модель обрабатывает язык и принимает решения. Harness соединяет её с реальной средой. Он предоставляет файлы, регистрирует инструменты, управляет состояниями, запускает субагентов, выполняет команды и решает, какая информация снова попадёт в контекст при следующем обращении к модели.

Таким образом, harness не просто оболочка вокруг модели. Он определяет, во что вообще может превратиться ответ модели. Агенту разрешено только выводить текст или также изменять файл? Он видит весь репозиторий или лишь рабочую папку? Команда выполняется непосредственно на хосте, в контейнере или в удалённой sandbox-среде? Должен ли человек одобрить действие? Сохраняется ли состояние между сессиями? Всё это не свойства модели, а решения окружающей её runtime-среды.

От ответов к действиям

В простом чате это разделение почти незаметно. Вопрос поступает на вход, ответ выходит. Но как только агент начинает работать с репозиторием, обрабатывать заявки, обращаться к внутренним системам или выполнять длительные задачи, harness становится как минимум не менее важным, чем модель. Он переводит выраженное словами намерение в последовательность реальных шагов и возвращает их результаты модели в виде нового контекста.

Именно здесь решается, станет ли впечатляющая демонстрационная технология надёжным инструментом. Очень хорошая модель с плохим контекстом, слишком широкими правами и ненадёжным управлением сессиями остаётся плохим агентом. Она может блестяще рассуждать и всё же изменить не тот файл, использовать устаревшее состояние или не суметь корректно продолжить работу после ошибки. И наоборот, несколько более слабая модель в хорошо построенной runtime-среде может оказаться удивительно полезной, потому что видит правильные инструменты, имеет чёткие ограничения, а её работа остаётся прослеживаемой.

Архитектура становится частью результата

DeepSeek Harness делает этот слой видимым. Ядро Cordis монтирует плагины, разрешает зависимости и умеет снова удалять компоненты. Возможности предоставляются как services. Например, один плагин может реализовать shell, другой делает эту shell доступной как инструмент модели, а третий использует инструмент в workflow. Конкретную реализацию можно заменить через конфигурацию без перестройки всего harness.

DeepSeek идёт дальше многих платформ, которые разрешают лишь добавлять несколько инструментов в виде расширений. Подключение модели, tool registry, session log и сам цикл агента также являются плагинами. Согласно архитектуре, не существует привилегированного ядра, которое пришлось бы модифицировать ради каждого расширения. Новое поведение монтируется рядом с имеющимися компонентами, а при удалении может аккуратно отменить свои регистрации.

Сама идея не совершенно нова. Операционные системы, браузеры, редакторы и платформы десятилетиями опираются на модульные компоненты. Новизна в том, насколько последовательно DeepSeek переносит этот принцип на полноценного ИИ-агента. Архитектура агента больше не принимается как неизменный продукт, а становится набором решений, который оператор может менять.

Почему идея «всё является плагином» так привлекательна

Плагинный подход переносит власть от готового продукта к компонуемой runtime-среде. Я могу заменить поставщика модели, не перестраивая полностью свой рабочий процесс. Могу поменять локальную shell на более изолированный вариант. Могу использовать другое хранилище, другую логику сессий или собственный интерфейс. Помимо доступа к своим моделям, DeepSeek документирует и других поставщиков, а также пользовательские endpoint-ы, совместимые с OpenAI.

Смена модели без полного перезапуска

Так агент становится скорее инфраструктурой, которую я собираю под собственное окружение. Небольшой команде разработчиков, возможно, нужны только доступ к файлам, Git и тесты. Команда security дополнительно захочет сетевые запросы, изолированные sandbox-среды, более строгие согласования и неизменяемые журналы. Компания может использовать собственный model gateway, а домашняя лаборатория обращаться к локальной open-weight-модели.

Стратегически это важно, потому что модели сейчас меняются очень быстро. Сегодня один поставщик силён в coding, завтра другой лучше справляется с длинным контекстом или инструментами. В закрытом продукте смена модели часто одновременно означает смену платформы. Сессии, правила, разрешения, интеграции и рабочие процессы приходится строить заново. В модульной runtime-среде модель остаётся компонентом, который можно заменить другим provider-ом или самостоятельно размещённым endpoint-ом.

Полностью бесшовным этот процесс не будет. Модели различаются форматами ролей, reasoning, вызовами инструментов, поддержкой изображений и поведением при ошибках. Поэтому такие различия необходимо правильно учитывать в соответствующих адаптерах. Но именно здесь проявляется ценность чёткой границы: особенности одного поставщика не расползаются бесконтрольно по всему продукту.

Взаимозаменяемая инфраструктура, а не взаимозаменяемые кнопки

Особенно интересным выглядит разделение определения, поставщика и пользователя возможности. Интерфейс Bash описывает, что эта возможность умеет. Provider решает, где и как на самом деле выполняются команды. И только ещё один плагин превращает её в инструмент, который может вызвать модель. Такие границы важны, потому что позволяют встроить контроль в чётко определённой точке. Там можно добавить ограничения времени, изоляцию, согласования и журналирование, не переписывая каждый цикл агента.

Потенциал становится очевидным, когда несколько возможностей используют один и тот же мир выполнения. Если файловая система и процессы переносятся из локального окружения в удалённую sandbox-среду, shell, терминал и навигация по коду могут переместиться туда вместе с ними. Для пользователя возможность остаётся похожей, а лежащие под ней рамки безопасности и эксплуатации принципиально меняются. Такая взаимозаменяемость ценнее дополнительного переключателя в интерфейсе.

Различные runtime-режимы также показывают намерения DeepSeek. Стандартный режим включает полноценного coding-агента. В Code Mode модель может оркестрировать несколько вызовов инструментов посредством сгенерированного TypeScript-кода. Minimal Mode сокращает среду для бенчмарков до shell и редактора. В Creator Mode можно изучать плагины и собственные presets. Поэтому каждому сценарию использования не приходится загружать один и тот же огромный набор инструментов.

Profiles и bundles превращают это в нечто большее, чем свободную коллекцию расширений. Profile может задавать runtime-среду агента для конкретной цели. Можно представить облегчённый profile для локальной разработки, более ограниченный для производственных систем и forensic-profile с особенно подробным журналированием. Возможности составляются из одних и тех же блоков, но их сочетание и границы соответствуют конкретному риску.

Управление плагинами DeepSeek Harness со списком установленных модулей и их состоянием

Где потенциал проявляется на практике

Архитектура интересна, но её ценность проявляется только в конкретных ситуациях. Плагинная система не является самоцелью. Она должна позволять быстрее адаптировать агента к реальным требованиям, не создавая новую платформу для каждого сценария.

От личного инструмента к корпоративной платформе

Один разработчик может начать с локальной shell, файлового редактора и модели. Но когда из этого получается командный инструмент, возникают другие требования: централизованные идентификаторы, раздельные workspaces, согласования критических действий, model gateway, контроль затрат, постоянные сессии и экспортируемый audit trail. В монолитном приложении производитель решает, появятся ли эти функции и когда.

В модульной runtime-среде компании могут самостоятельно дополнять недостающие части или заменять имеющихся provider-ов. Агент не требует повторного изобретения. Один и тот же интерфейс и одна логика агента могут использовать другие модели за корпоративным gateway, выполнять команды во внутренней sandbox-среде и сохранять сессии в собственном storage. В этом разница между удобным инструментом и контролируемой платформой.

Разные зоны доверия из одинаковых блоков

Не каждой задаче нужны одинаковые права. Агенту, который составляет краткое изложение документации, не требуется доступ к production. Агенту для incident response могут понадобиться журналы и сетевые запросы, но не право менять конфигурацию. Агент для deployment может выполнять изменения, однако ему необходимы более строгие согласования, короткоживущие токены и особенно ясное журналирование.

При чётком разделении services и profiles такую дифференциацию можно выразить в самой runtime-среде. Модели не требуется понимать каждую деталь безопасности и добровольно её соблюдать. Именно окружение технически решает, какие возможности вообще присутствуют. Для security это центральный момент: немонтированная возможность даже не доступна модели как прямой инструмент.

Экосистема для специалистов

Ни один поставщик не создаст одновременно лучшую sandbox-среду, лучший session store, каждую корпоративную систему и все адаптеры моделей. Открытая плагинная модель позволяет специалистам хорошо решить ровно один слой. Поставщик security может предложить усиленную среду выполнения. Проект storage может обеспечить сессии с поддержкой аудита. Внутренняя платформенная команда может связать согласования и идентификаторы с собственной организацией.

Если такие компоненты сочетаются через стабильные интерфейсы, возникает экосистема, а не одно постоянно разрастающееся приложение. Вероятно, в этом заключается крупнейший потенциал DeepSeek Harness. DeepSeek не обязана победить во всех сценариях использования. Достаточно, чтобы её архитектура стала местом, где другие предлагают и объединяют свои возможности.

Прослеживаемость не второстепенная деталь

Вторая сильная идея после плагинов заключается в append-only session log. По словам DeepSeek, всё, что видит модель, фиксируется как событие. Это системные инструкции, вызовы инструментов и результаты, инъекции контекста, а также планирование субагентов. Продолжение, ветвление, поиск и повторение основаны на одном потоке событий.

Для разработчиков это удобно, поскольку неудачный запуск можно реконструировать. Для security и эксплуатации это ещё важнее. Когда агент изменяет файл, запускает команду или отправляет данные сервису, мне нужно больше, чем последнее сообщение чата. Я должен понимать, какой контекст был доступен, какой инструмент участвовал и в какой момент решение перешло в действие.

В классических приложениях ошибку часто можно свести к входным данным и детерминированному пути кода. С агентами сложнее. Из одного и того же общего задания модель может вывести разные промежуточные шаги, использовать инструменты в другом порядке и по-разному отреагировать на неожиданные результаты. Без полной истории остаётся лишь утверждение, что агент что-то решил. Этого недостаточно ни для debugging, ни для расследования инцидента безопасности.

Решение сделать поток событий source of truth открывает вторую возможность: лучше сопоставимые эксперименты. Сессию можно разветвить в определённой точке и продолжить с другой моделью, изменённым prompt или иными возможностями. Тогда сравнивается не только то, какая модель пишет более красивый ответ. Можно исследовать, как конкретное изменение влияет на одно и то же реальное рабочее состояние.

Для компаний это со временем может превратиться в своеобразный журнал изменений и инцидентов агентов. Кто дал поручение? Какая политика действовала? Какие данные получила модель? Какое действие было одобрено? Какой результат вернулся? Эти вопросы становятся важными, как только агенты перестают лишь консультировать и начинают менять реальные системы.

Однако сам по себе log ещё не является готовым audit trail. Хранение, защита доступа, целостность, конфиденциальные данные и экспорт по-прежнему требуют правильного решения. Полный журнал сам может стать риском, если содержит prompts, исходный код, результаты инструментов или учётные данные. Тем не менее мне нравится основополагающее решение: информация, видимая модели, должна поступать не из скрытого бокового канала, а из реконструируемого потока событий.

Просмотр trajectory полного запуска агента в DeepSeek Harness

Open source становится стратегическим оружием

То, что этот проект появился в Китае, делает ситуацию ещё интереснее. DeepSeek публикует не только веса моделей, но и заметно строит несколько слоёв stack. DeepSeek V4 доступна с весами и кодом под лицензией MIT. Теперь Harness, тоже лицензированный по MIT, добавляет открытую runtime-среду для агентной работы. А ниже располагается Cordis с собственной моделью плагинов и композиции.

Это соответствует тенденции, которую я уже описывал в статье об ИИ, безопасности и борьбе за полный stack. Китай не хочет только потреблять приложения ИИ. Китайские компании создают модели, программное обеспечение для инференса, аппаратные пути и теперь ещё агентную инфраструктуру над ними. DeepSeek демонстрирует темп, который на Западе уже невозможно объяснить прежним образом обычной индустрии копирования.

Open source в этой гонке не только идеализм. Это дистрибуция, доверие благодаря проверяемости и ускоритель экосистемы. Тот, кто открывает веса, код и интерфейсы, приглашает разработчиков со всего мира искать ошибки, строить интеграции и превращать собственный дизайн в стандарт де-факто. Открытый harness может оказаться стратегически ценнее для DeepSeek, чем ещё один закрытый чат-интерфейс, потому что сохраняет актуальность и тогда, когда внутри работают модели других поставщиков.

Это примечательный момент. DeepSeek строит платформу, в которой сама DeepSeek остаётся заменяемой. В краткосрочной перспективе это кажется почти противоречием. Зачем поставщику моделей облегчать переход к конкуренту? В долгосрочной перспективе именно это может оказаться более сильной позицией. Если разработчики создают своих агентов, плагины, правила безопасности и сессии на этой runtime-среде, Harness становится общей инфраструктурой. DeepSeek может потерять отдельные вызовы модели, но приобретает влияние на архитектуру всей экосистемы.

Открытость также ускоряет обучение. В закрытом продукте развитие основной архитектуры в значительной степени остаётся у производителя. Открытый проект применяется пользователями в средах, которые исходная команда никогда не могла полностью предвидеть. Так возникают сообщения об ошибках, новые адаптеры, альтернативные backends и эксплуатационные знания. Особенно в такой молодой области, как агентное ПО, эта обратная связь может быть важнее идеального первого релиза.

Именно в этом заключается умная сторона плагинного подхода. DeepSeek не требуется самостоятельно создавать каждое хранилище, каждую sandbox-среду и каждую корпоративную систему. Она предоставляет архитектуру, куда другие могут добавить эти возможности. По мере роста экосистемы ядро выигрывает от каждой новой интеграции.

Китай строит не только модель, но и путь вокруг неё

Поэтому геополитическое значение заключается не только в показателях бенчмарков. Страна или экономический регион не становится технологически суверенным лишь потому, что где-то была обучена сильная модель. Необходимы аппаратное обеспечение, ПО для инференса, средства разработки, интерфейсы, эксплуатационный опыт и разработчики, создающие на этой основе продукты. DeepSeek Harness является ещё одним элементом именно этой цепочки.

Западный нарратив о китайских технологиях часто отстаёт от данного развития. Тот, кто продолжает видеть в Китае прежде всего дешёвого копировщика, упускает скорость, с которой там публикуют собственные архитектуры и обращаются к глобальным разработчикам. DeepSeek не обязана постоянно лидировать во всех категориях. Достаточно сохранять небольшой отрыв, быстро итерировать и открывать работу так, чтобы другие могли строить поверх неё.

Разрыв с ведущими закрытыми моделями сокращается

Долгое время open-weight-модели считались интересной альтернативой для лабораторий и специальных задач, а действительно сильные возможности оставались у нескольких закрытых поставщиков. Эта картина всё хуже соответствует действительности. Разрыв исчез не в каждой дисциплине, но сокращается быстрее, чем ожидали многие.

В собственных оценках DeepSeek располагает модели V4 непосредственно рядом с нынешними ведущими закрытыми моделями. В зависимости от бенчмарка V4 Pro приближается к ним, достигает сопоставимых результатов или заметно отстаёт. Для software engineering, использования инструментов, фактических знаний и очень сложных задач reasoning нет единого результата. Именно поэтому не следует определять «победителя» по одной таблице.

Более важен временной разрыв. Возможности, которые совсем недавно считались эксклюзивным преимуществом крупнейших американских лабораторий, через несколько месяцев появляются в моделях, чьи веса можно скачать, самостоятельно запустить и исследовать. «Всего на несколько месяцев позади лучших моделей» не является научно измеримой константой. Но эта формулировка довольно точно описывает, насколько недолговечным теперь может казаться преимущество закрытых систем.

Вместе с этим меняется и экономическое значение преимущества. Если закрытая модель на десять процентов лучше справляется с определённой задачей, это может быть решающим. Но если открытая модель достаточно хороша, работает на собственной инфраструктуре и интегрируется в собственную зону безопасности, итоговый расчёт всё равно может оказаться в пользу открытой модели. Контроль, расположение данных, предсказуемые затраты и возможность собственной адаптации являются частью производительности, даже если не появляются в бенчмарке.

При этом нельзя забывать об аппаратной части. Открыто доступные веса не означают автоматически, что модель с 1,6 триллиона параметров удобно запустится в серверном шкафу. DeepSeek V4 Pro представляет собой огромную Mixture-of-Experts-модель. Даже если на каждый токен активна лишь часть параметров, требования к памяти, стоимость инференса и эксплуатация остаются сложными. Открытость устраняет барьер доступа к коду и весам, но не физическую реальность больших моделей.

И всё же одно существование этих весов уже меняет рынок. Исследователи могут изучать модель. Поставщики могут предоставлять её на собственной инфраструктуре. Сообщества могут разрабатывать квантизации и оптимизации runtime. Компании получают хотя бы альтернативу полной зависимости от единственного API.

В результате конкуренция смещается. Сырые знания модели остаются важными, но долгосрочная ценность всё больше заключается также в data pipelines, оценках, runtime, безопасности, дистрибуции и включении в реальные процессы. Открытый harness точно соответствует этому сдвигу. Если модели быстрее становятся взаимозаменяемыми, выигрывает платформа, которая надёжно предоставляет им контекст, инструменты и границы.

Открытость не означает надёжность автоматически

При всём энтузиазме было бы наивно автоматически приравнивать «open source из Китая» к суверенитету. Пользователь размещённого сервиса DeepSeek по-прежнему отправляет данные внешнему поставщику. Только самостоятельно эксплуатируемый endpoint модели и контролируемый harness действительно меняют суверенитет данных. Но даже тогда происхождение, процесс build, зависимости и обновления остаются частью supply chain.

Плагины усиливают эту ответственность. Плагин не безобидная тема оформления. Он может регистрировать инструменты, обращаться к services и исполнять код в системе. При установке из Git-репозиториев документация DeepSeek прямо предупреждает, что разрешённые build scripts могут выполняться на хосте за пределами sandbox агента. Она рекомендует допускать только доверенные источники и фиксировать зависимости на конкретном commit.

Это именно то предупреждение, которое необходимо. Открытая плагинная платформа создаёт взаимозаменяемость, но вместе с ней и новую supply chain. Каждый дополнительный поставщик может получить доступ к prompts, файлам, учётным данным или исполняемым инструментам. Скомпрометированному плагину не нужен эффектный jailbreak модели, если он уже является легитимной частью runtime.

Возможность просматривать исходный код представляет собой преимущество, но ещё не является проверкой безопасности. Кто-то должен действительно изучать код, отслеживать builds, фиксировать версии и контролировать обновления. В растущей плагинной экосистеме происхождение становится почти таким же важным, как функция. Полезный плагин из неизвестного источника может оказаться большим риском, чем отсутствующая возможность.

Поэтому для серьёзной эксплуатации я использовал бы лишь несколько проверенных плагинов. Версии необходимо фиксировать, разрешения разделять, secrets хранить вне конфигурации, а исходящие соединения контролировать. Sandbox-среды должны действительно изолировать, а не просто так называться. Session log следует защищать и проверять на конфиденциальные данные. И прежде всего утверждение «всё является плагином» не должно превратиться в «каждому плагину разрешено всё».

Долгосрочный потенциал поэтому зависит и от governance. Хорошей платформе нужны понятные доказательства происхождения, подписанные артефакты, воспроизводимые builds, ясные зависимости и возможность ограничивать capabilities для каждого profile. Если DeepSeek и сообщество отнесутся серьёзно к этим скучным основам, открытость может привести к реальному контролю. В противном случае обещание плагинов станет просто огромной поверхностью атаки.

Что я хотел бы увидеть от DeepSeek Harness

DeepSeek сознательно называет проект Developer Preview и предупреждает о несовместимых изменениях. Сейчас подходящее время для чтения, экспериментов и тестов с некритичными данными. Но ещё нет причин делать от него зависимыми основные производственные процессы.

Интересно будет увидеть, превратится ли чистая архитектура в устойчивую экосистему. Для этого нужны подписанные релизы, прослеживаемое происхождение плагинов, чёткие модели разрешений, воспроизводимые builds и процесс обновления, который не требует нового доверия при каждой замене. Не менее важен вопрос, насколько хорошо плагины разных поставщиков действительно сочетаются при быстром развитии проекта.

Я также хочу увидеть, выдержит ли обещанная взаимозаменяемость повседневную эксплуатацию. На бумаге адаптер модели поменять легко. На практике модели различаются вызовами инструментов, reasoning, форматами контекста, поддержкой изображений и режимами отказа. Открытый интерфейс уменьшает эти различия, но не устраняет их.

Несмотря на эти оговорки, DeepSeek Harness представляется мне одним из наиболее интересных ИИ-проектов этого года. Не потому, что уже обязан быть лучшим coding-агентом. Интересно другое: китайская ИИ-компания открывает слой над моделью и превращает его в конструктор. Пока другие поставщики всё глубже интегрируют агентов в закрытые платформы, DeepSeek выбирает архитектуру, где даже её собственная модель является лишь взаимозаменяемым плагином.

Моё впечатление и невероятная скорость

Уже Developer Preview показывает мне большой потенциал. Интерфейс делает плагинный принцип осязаемым, а представление trajectory демонстрирует, что прослеживаемость не планируют добавлять задним числом. Проект пока молод и многое меняется, но именно эта открытая архитектура выглядит основой, на которой очень быстро может возникнуть нечто большое.

Сейчас в мире ИИ происходит столько всего, что даже отставание в несколько недель может выглядеть устаревшим. И кого это удивляет, если одна только Alphabet ожидает капитальные расходы от 175 до 185 миллиардов долларов в 2026 году, а Meta ещё от 115 до 135 миллиардов, причём в обоих случаях значительную роль играет инфраструктура ИИ? Сотни миллиардов внезапно направляются в одну идею, одну конкуренцию и одно будущее.

Этот капитал не гарантирует хороших продуктов. Но он объясняет, почему модели, дата-центры и агентные платформы развиваются с темпом, который несколько лет назад казался невозможным. Модели становятся взаимозаменяемыми, открытые веса быстро догоняют, а решающая дифференциация переходит в harness. DeepSeek заметно ускоряется во всех трёх направлениях. Тем, кто строит инфраструктуру ИИ, стоит воспринимать это не только как историю китайской конкуренции, но и как приглашение заново оценить собственную зависимость от закрытых stack.

До следующего раза,
Joe

Источники