У серпні 2026 року DeepSeek відкрила DeepSeek Harness (dsh) у статусі developer preview. Проєкт є open source під ліцензією MIT і не обмежується роллю ще одного coding agent у терміналі. DeepSeek позиціонує його як agent harness, тобто рівень, що поєднує модель із tools, пам’яттю session, sandbox, approval policy, subagents, web search, skills, workflows та користувацьким інтерфейсом.[1][2]
Головний архітектурний принцип:
Everything is a plugin.
Моделі, tools, skills, sessions, sandboxes, storage, agent loop, scheduling, subagents і навіть UI компонуються як plugins поверх Cordis.[1][3][11]
Це відрізняється від звичайного продукту з фіксованим agent loop та фіксованою tool surface. У dsh навіть сам agent loop можна замінити через конфігурацію.[3]
Водночас це не означає, що DeepSeek Harness сьогодні зріліший за Claude Code, Codex або Muse Code. Офіційний SAFETY.md прямо називає його experimental developer-preview software, вказує, що він не проходив security audit, і застерігає не вважати його secure чи production-ready.[6]
Публічна npm-версія @deepseek-ai/dsh, перевірена 31 серпня, — 0.1.1-rc.2.[10]
Коротко: DeepSeek Harness зараз найбільш цікавий як відкрита та замінювана інфраструктура для створення власних агентів. Він також може делегувати роботу справжнім Claude Code і Codex як субагентам, тому може одночасно конкурувати з ними й виступати шаром оркестрації над ними.[8][9]
Стан інформації: 31 серпня 2026 року.
TL;DR
| Питання | Перевірена відповідь |
|---|---|
| Що таке DeepSeek Harness? | Open-source agent harness і runtime |
| Ліцензія | MIT |
| Статус | Developer preview |
| Поточна npm-версія | 0.1.1-rc.2 |
| Production-ready? | Ні, згідно з SAFETY.md |
| Security audit? | Проєкт заявляє, що не проходив |
| Основна архітектура | Everything is a plugin |
| Базовий framework | Cordis |
| Лише DeepSeek-моделі? | Ні |
| Інші providers | Anthropic, OpenAI, Bedrock, Vertex, Azure, custom endpoints |
| Власна модель? | Так, через provider/adapter |
| Інтерфейси | Web UI, headless, SDK і profiles |
| Subagents? | Так |
| Claude Code як subagent? | Так |
| Codex як subagent? | Так |
| Codex CLI open source? | Так, Apache-2.0 |
| Claude Code open source на подібних умовах? | Ні, repo посилається на Anthropic Commercial Terms |
| Muse Code | Beta |
| Є спільний чесний benchmark? | Ми не знайшли публічного harness-identical benchmark |
| Найбільша перевага | Composability та замінюваність runtime |
| Найбільший ризик | Незрілість developer preview і широкі локальні права |
Що таке agent harness?
Мовна модель сама по собі не є повноцінним агентом.
Вона може генерувати текст, код, плани чи tool calls, але інший рівень має визначати:
- які tools доступні,
- як виконуються commands,
- куди агент може записувати,
- коли потрібен approval,
- де зберігається session history,
- як відновлювати run,
- як делегувати задачі,
- як підключати зовнішні моделі.
DeepSeek формулює це так:
Agent = Model + Harness
Harness є runtime-рівнем, який дозволяє моделі діяти в реальному середовищі.
Чому не просто ще один CLI?
DSH має CLI, Web UI і headless mode, але проєктується ширше за одного coding assistant.[1][3][5]
Ідея:
не hardcode capabilities у loop,
а монтувати їх як замінювані компоненти
До них належать model adapters, tools, filesystem, shell, sandbox, skills, web access, persistence, compaction, subagents, jobs, scheduling, approvals і UI.[1][3]
“Everything is a plugin” включає навіть agent loop
Документація архітектури прямо називає model adapter, tool registry, session log та agent loop plugins.[3]
У багатьох продуктах tools можна додавати, але цикл:
prompt → model → tool → model → finish
залишається фіксованою внутрішньою логікою.
У DSH замінюваною capability є і сама loop. Документація каже, що для розширення поведінки не потрібно patch-ити privileged core.[3]
Cordis як фундамент
DeepSeek Harness побудований на Cordis.[1][3]
26 серпня 2026 року автори, пов’язані з Peking University та DeepSeek-AI, опублікували A Programming Paradigm for Spatiotemporal Composability.[11]
Cordis працює з двома типами composability:
- temporal composability, коли компонент можна прибрати разом із його runtime effects;
- spatial composability, коли компонент декларує dependencies і реагує на зміни середовища.
Реалізація містить effect tracking, dependency resolution, declarative loading, configuration reconciliation і hot module replacement.[11]
Profiles і bundles
Запущений dsh є деревом plugins, зібраним під час boot.[3]
Profiles — це іменовані runtime-композиції, наприклад:
web
headless
Bundles постачають Cordis configuration і код.
dsh-base включає model adapters, tools, persistence, sandbox, approval policy, settings, credentials та telemetry.[3]
dsh-web-app додає browser app, а dsh-headless — one-shot runner без сервера.
Багаторівнева конфігурація
Конфігурація застосовується шарами:[3]
bundles
↓
profile cordis.patch.yml
↓
home cordis.patch.yml
↓
--patch overlay
Ефективне дерево можна перевірити:
dsh --profile web --dump-config
Для внутрішньої agent platform це часто чистіше, ніж змінювати upstream source.
Web UI
Офіційний quick start:
npx @deepseek-ai/dsh web
За замовчуванням Web UI працює локально на:
http://127.0.0.1:3080
Після налаштування model і workspace агент може читати та редагувати файли, виконувати commands, делегувати роботу й підтримувати план.[5]
DeepSeek Harness не прив’язаний до моделей DeepSeek
Settings → Models підтримує інших providers.[4]
Офіційна документація називає:
- Anthropic,
- OpenAI,
- Amazon Bedrock,
- Google Vertex,
- Azure,
- Codex,
а також custom providers для company gateways, self-hosted servers та OpenAI-compatible endpoints.[4]
DeepSeek Harness ≠ DeepSeek-model-only
Власну модель можна додати через LLM adapter
ctx.llm є registry адаптерів.[3][4]
Документований pattern:
class MyAdapter extends LlmAdapter {
async *stream(options) {
// provider implementation
}
}
Adapter перетворює:
Harness request
↔
provider API
Модель можна змінити без restart Web UI
Зміни model configuration стають доступними на наступній request без перезапуску сервера.[4]
Обрана модель стає default для нових sessions.
Session, що вже виконала request, зберігає модель, записану у своєму log.[4]
Чотири runtime modes
DeepSeek описує чотири режими.[1]
Standard
Повний coding agent з file editing, shell, file/web search, skills, planning, goals, subagents та workflows.
Code
Standard плюс Code Mode SDK, щоб модель могла поєднати кілька tool operations в одну TypeScript-програму.[1]
Minimal
persistent bash
str_replace_editor
Придатний, зокрема, для benchmark моделей з мінімальною tool surface.[1]
Creator
Для runtime inspection, plugin experiments та custom presets.[1]
Append-only session log
DeepSeek заявляє, що все, що бачить модель, записується в append-only session log.[1]
Це включає system prompts, reasoning, tool calls/results, subagent scheduling та context injections.[1][3]
Resume, fork, search і replay використовують той самий event stream.
“Model-visible means logged”
Документація формулює правило:
Model-visible means logged.
Усе, що потрапляє в model request, має бути відтворюваним із session log.
Це корисно для audit і debugging.
Subagents як capability
ctx.subagents є registry providers.[8]
Документовані реалізації:
spawn-in-process
fork
ACP
Codex
Claude Code
dsh-sdk
Parent agent може делегувати через спільний interface без знання внутрішнього child runtime.
DSH може запустити справжній Codex
Provider:
@deepseek-ai/dsh-subagent-codex
не є просто HTTP-запитом до OpenAI model.[9]
Він запускає реальний Codex product як окремий process.
Документована implementation використовує:
@openai/[email protected]
та app-server --stdio.[9]
Кожна call створює новий process, ephemeral thread і one-shot task.
Так само можна делегувати Claude Code
Інший first-party provider інтегрує справжній Claude Code.[8][9]
Потік:
task
→ subagent provider
→ Claude Code
→ final result
Child отримує self-contained task і workspace, але не автоматично всю parent conversation.[9]
Це змінює сенс порівняння
Просте:
DSH vs Claude Code vs Codex
є неповним.
Точніше:
DeepSeek Harness
├── власний runtime
├── model providers
├── Claude Code як child
└── Codex як child
DSH може бути конкурентом і orchestrator одночасно.
Компроміс — більша складність і ширша attack surface.
Agent Teams експериментальні
Repo містить Agent Teams з durable roster, task board, mailbox та child sessions.[3]
Але документація називає цю частину experimental private opt-in coordination seam.[3]
Її не слід подавати як стабільну public API.
DeepSeek Harness vs Claude Code
Claude Code є готовим coding-agent product для software engineering.
Він може досліджувати codebase, редагувати файли, запускати commands і tests, працювати з Git та MCP.[12]
Різниця:
Claude Code = готовий coding product
DSH = composable framework/runtime
Repo Claude Code вказує на використання за Anthropic Commercial Terms.[12]
DeepSeek Harness vs OpenAI Codex
Важливе уточнення: Codex CLI також open source.
Repo openai/codex ліцензований як:
Apache-2.0
Тому некоректно називати DSH open-source альтернативою «закритому Codex».
Codex — передусім coding-agent platform із CLI, IDE, desktop, cloud, sandboxing, approvals та network policies.[13]
DSH більше зосереджений на власній композиції runtime і водночас може запустити Codex як child.[9]
DeepSeek Harness vs Muse Code
Meta запустила Muse Code 5 серпня 2026 року як beta terminal coding agent з Muse Spark 1.2.[14]
Muse Code і модель були co-trained для planning, tool use, context compaction, subagents і довгих coding tasks.[14]
Архітектурна різниця:
Muse = model + harness спільно оптимізовані
DSH = model і capabilities замінювані
Порівняльна таблиця
| Функція | DeepSeek Harness | Claude Code | OpenAI Codex | Muse Code |
|---|---|---|---|---|
| Характер | framework/runtime | coding agent | coding agent/platform | coding agent |
| Статус | developer preview | продукт | продукт | beta |
| Ліцензія harness | MIT | Commercial Terms | Apache-2.0 | launch не описує зіставний open framework |
| Multi-model by design | Так | переважно Claude | переважно OpenAI | Muse Spark |
| Custom provider | Так | integrations/gateways | OpenAI ecosystem | без зіставного шару, описаного на launch |
| Web UI | Так | переважно terminal/IDE | CLI, IDE, desktop, cloud | terminal |
| Headless | Так | Так | Так | CLI |
| Plugin-first core | Так | не в такому ж обсязі | не в такому ж обсязі | не в такому ж обсязі |
| Замінюваний agent loop | Так | не основний contract | не основний contract | не основний contract |
| Subagents | Так | Так | Так | Так |
| Claude Code child | Так | N/A | не головна мета | Ні |
| Codex child | Так | не головна мета | N/A | Ні |
| Офіційний not production-ready warning | Так | Ні | Ні | Beta |
Таблиця порівнює поверхню продуктів, а не інтелект моделей.
Чому ми не даємо benchmark у відсотках?
Ми не знайшли публічного тесту, який одночасно тримає незмінними:
ту саму модель
той самий prompt
те саме repo
ті самі tools
той самий sandbox
той самий budget
той самий час
той самий grading
Порівняння Opus + Claude Code з DeepSeek model + DSH вимірює забагато змінних одночасно.
Як чесно benchmark-ити harness?
Test A: однакова модель
та сама модель + DSH
vs
та сама модель + мінімальний harness
Test B: end-to-end
Claude + Claude Code
OpenAI + Codex
Muse Spark + Muse Code
обрана модель + DSH
Міряти task completion, test pass rate, cost, time, tool calls, human interventions, regressions, out-of-scope changes, security incidents та restart recovery.
Безпека — найважливіша частина
Офіційний SAFETY.md дуже прямий.[6]
DSH може виконувати model-generated code і commands, завантажувати third-party plugins та отримувати доступ до network, processes, credentials і files.
Помилковий output моделі, bug, misconfiguration, malicious input або untrusted plugin може змінити чи видалити файли, розкрити дані або пошкодити host.[6]
Sandbox не гарантує ізоляцію
DeepSeek пише:
Sandboxing, approval prompts, and permission controls can reduce risk, but they do not guarantee isolation or prevent damage.[6]
Рекомендуються least privilege, disposable VM/container, backups, мінімізація secrets і review pluginів та commands.
DSH не повинен бути єдиним security control для untrusted workloads.
Local-first не означає local-only
Data Processing Statement називає Harness local-first.[7]
За замовчуванням локально зберігаються inputs, outputs, session context, tool records, attachments, file paths та runtime logs.
Але external models, web tools, MCP servers та plugins можуть передавати дані своїм providers.[7]
local-first ≠ local-only
Telemetry складніша за просте on/off
Поведінка telemetry змінювалася протягом серпня.[16]
FULL потребує explicit configuration. Нові profiles не надсилають автоматично повний session log без активного вибору; feedback залежно від mode може активувати вужчий reporting path.[16]
Data Processing Statement також згадує можливе reporting анонімізованої конфігураційної інформації та project lists з можливістю вимкнення або зміни endpoint.[7]
Кожен deployment має перевіряти точну версію та конфігурацію.
Developer preview означає реальні breaking changes
README попереджає:
THERE WILL BE COMPATIBILITY-BREAKING CHANGES.
У серпні RC виходили швидко аж до 0.1.1-rc.2.[10]
GitHub Discussions також містить community reports про неузгоджені npm dist-tags для деяких plugin packages біля rc.2.[15]
Це не офіційне підтвердження проблеми для всіх інсталяцій, але воно відповідає preview status.
Чи варто вже писати власні plugins?
Для R&D — так, якщо churn прийнятний.
Офіційні extension points є для tools, LLM adapters, settings cards, capabilities, conversation nodes, storage, filesystem, sandbox та subagent providers.[3][4]
Для команд, яким потрібна багаторічна API stability, проєкт поки молодий.
Для кого DSH найбільш цікавий?
Agent platform teams
Для внутрішньої платформи, незалежної від одного model vendor.
AI infrastructure R&D
Для експериментів з loops, context policies, routing, subagents та sandboxes.
Multi-model організації
Як control plane над DeepSeek, Anthropic, OpenAI, внутрішніми gateways та self-hosted models.
Benchmarking
Minimal mode може зменшити tool surface для модельних тестів.[1]
Коли краще Claude Code, Codex або Muse Code?
Claude Code якщо потрібен зрілий coding agent у Claude ecosystem.
Codex якщо потрібна OpenAI platform через CLI, IDE, desktop і cloud із зрілішими sandbox/governance controls.[13]
Muse Code якщо потрібна co-trained пара model+harness з Muse Spark 1.2.[14]
DeepSeek Harness якщо головна мета:
побудувати власний harness,
а не лише користуватися готовим агентом
Checklist перед production
Версія та supply chain
- Pin конкретну версію
@deepseek-ai/dsh. - Перевірити scope
@deepseek-ai. - Перевірити upstream repo.
- Не замінювати upstream невідомими wrappers.
- Pin plugin versions.
- Перевірити сумісність CLI/plugins.
Runtime
- Dedicated user.
- Мінімальний workspace.
- Secrets поза workspace.
- Backups.
- Approval для destructive commands.
- Обмежений network access.
- Негативні sandbox tests.
- Не вважати sandbox ідеальною межею.
Моделі
- Знати, який provider отримує code.
- Перевірити retention policy.
- TLS/auth для власного gateway.
- API keys з мінімальним scope.
- Логувати model routing.
- Тестувати кілька моделей.
Plugins
- Review third-party plugins.
- Мінімальні capabilities.
- Довірені MCP servers.
- Skills перевіряти як code.
- Без auto-update без review.
Якість
- Acceptance tests.
- Агент запускає tests.
- Review final diff.
- Вимірювати regressions.
- Вимірювати cost per successful task.
- Тестувати restart recovery.
- Чіткі межі subagents.
Висновок POLPROG
DeepSeek Harness — один із найцікавіших agentic-проєктів серпня 2026 року, але не тому, що DeepSeek просто створила «свій Claude Code».
Цікава саме архітектура:
model = plugin
tools = plugins
sandbox = plugin
session log = plugin
subagent provider = plugin
agent loop = plugin
UI = plugin
І parent agent може делегувати справжнім Codex та Claude Code.[8][9]
Правильне питання не:
Чи замінить DeepSeek Harness Claude Code?
А:
Чи почнуть компанії відокремлювати модель від harness і будувати власний control plane над кількома агентами?
Frontier-моделі змінюються швидко. Хороший harness може пережити кілька поколінь моделей.
DeepSeek намагається створити рівень, де можна замінити model, provider, sandbox, tool, agent loop та UI.
Це сильна архітектурна ідея.
Але станом на 31 серпня 2026 року DSH залишається developer preview. Upstream сам вказує, що security audit не проводився і продукт не є production-ready.[6]
Для R&D та контрольованих POC
Однозначно варто оцінити.
Як прямий фундамент critical production
Поки ні без власного hardening, sandboxing, version pinning, plugin review та повного POC.
Найбільша перевага DSH сьогодні не «краща модель», а спроба зробити так, щоб модель перестала бути архітектурним центром усього агента.

