In augustus 2026 bracht DeepSeek DeepSeek Harness (dsh) uit als developer preview. Het project is open source onder de MIT-licentie en is niet alleen een volgende terminalagent voor programmeren. DeepSeek positioneert het als een agent harness, de laag die een model verbindt met tools, sessiegeheugen, sandboxing, approval policy, subagents, web search, skills, workflows en de gebruikersinterface.[1][2]
Het centrale ontwerpprincipe is:
Everything is a plugin.
Modellen, tools, skills, sessions, sandboxes, storage, agent loop, scheduling, subagents en zelfs de UI worden als plugins bovenop Cordis gecomponeerd.[1][3][11]
Dat verschilt van een conventioneel product met een vaste agent loop en vaste tool surface. In dsh is zelfs de agent loop via configuratie vervangbaar.[3]
Dit betekent niet dat DeepSeek Harness nu al volwassener is dan Claude Code, Codex of Muse Code. Het officiële SAFETY.md noemt het expliciet experimental developer-preview software, zegt dat het geen security audit heeft ondergaan en dat het niet als secure of production-ready mag worden behandeld.[6]
De publieke npm-versie van @deepseek-ai/dsh, gecontroleerd op 31 augustus, is 0.1.1-rc.2.[10]
Kort samengevat: DeepSeek Harness is nu vooral interessant als open, vervangbare infrastructuur voor het bouwen van eigen agents. Het kan bovendien echte Claude Code- en Codex-processen als subagents starten, waardoor het tegelijk concurrent en orchestrator kan zijn.[8][9]
Informatiestatus: 31 augustus 2026.
TL;DR
| Vraag | Geverifieerd antwoord |
|---|---|
| Wat is DeepSeek Harness? | Open-source agent harness en runtime |
| Licentie | MIT |
| Status | Developer preview |
| Huidige npm-versie | 0.1.1-rc.2 |
| Production-ready? | Nee, volgens SAFETY.md |
| Security audit? | Volgens het project nog niet |
| Kernarchitectuur | Everything is a plugin |
| Onderliggend framework | Cordis |
| Alleen DeepSeek-modellen? | Nee |
| Andere providers | Anthropic, OpenAI, Bedrock, Vertex, Azure en custom endpoints |
| Eigen model mogelijk? | Ja, via provider/adapter |
| Interfaces | Web UI, headless, SDK en profiles |
| Subagents? | Ja |
| Claude Code als subagent? | Ja |
| Codex als subagent? | Ja |
| Is Codex CLI open source? | Ja, Apache-2.0 |
| Is Claude Code vergelijkbaar open source? | Nee, repo verwijst naar Anthropic Commercial Terms |
| Muse Code | Beta |
| Eerlijke gemeenschappelijke benchmark? | Geen publieke harness-identical benchmark gevonden |
| Grootste voordeel | Composability en vervangbaarheid |
| Grootste risico | Developer-preview-maturiteit en brede lokale rechten |
Wat is een agent harness?
Een taalmodel op zichzelf is geen complete agent.
Het kan tekst, code, plannen en tool calls genereren, maar een andere laag moet bepalen:
- welke tools beschikbaar zijn,
- hoe commands worden uitgevoerd,
- waar de agent mag schrijven,
- wanneer approval nodig is,
- waar session history wordt opgeslagen,
- hoe een run wordt hervat,
- hoe taken worden gedelegeerd,
- hoe externe modellen worden gekoppeld.
DeepSeek vat dit samen als:
Agent = Model + Harness
De harness is dus de runtime-laag die een model in een echte omgeving laat handelen.
Waarom niet gewoon nog een CLI?
DSH heeft een CLI, Web UI en headless mode, maar de architectuur is breder dan één coding assistant.[1][3][5]
De gedachte is:
capabilities niet hardcoden in de loop,
maar als vervangbare componenten monteren
Voorbeelden zijn model adapters, tools, filesystem, shell, sandbox, skills, web access, persistence, compaction, subagents, jobs, scheduling, approvals en UI.[1][3]
“Everything is a plugin” omvat de agent loop
De architectuurdocumentatie noemt model adapter, tool registry, session log en agent loop zelf plugins.[3]
Dat gaat verder dan een gewone extension marketplace.
In veel producten kun je tools toevoegen, terwijl:
prompt → model → tool → model → finish
intern vast blijft.
In DSH kan ook de loop zelf worden vervangen. De docs zeggen dat er geen privileged core is dat gepatcht moet worden om gedrag uit te breiden.[3]
Cordis is het fundament
DeepSeek Harness is gebouwd op Cordis.[1][3]
Op 26 augustus 2026 publiceerden onderzoekers met affiliaties bij Peking University en DeepSeek-AI A Programming Paradigm for Spatiotemporal Composability.[11]
Cordis richt zich op:
- temporal composability, waarbij runtime-effecten met een component kunnen verdwijnen;
- spatial composability, waarbij componenten dependencies declareren en op veranderingen reageren.
De implementatie biedt effect tracking, dependency resolution, declarative loading, configuration reconciliation en hot module replacement.[11]
Profiles en bundles
Een actieve dsh is een pluginboom die bij boot wordt samengesteld.[3]
Profiles zijn benoemde runtimecomposities, bijvoorbeeld:
web
headless
Bundles leveren Cordis-configuratie en code.
dsh-base bevat onder meer model adapters, tools, persistence, sandbox, approval policy, settings, credentials en telemetry.[3]
dsh-web-app voegt de browserapp toe en dsh-headless een one-shot runner zonder server.
Configuratie in lagen
Configuratie wordt in lagen toegepast:[3]
bundles
↓
profile cordis.patch.yml
↓
home cordis.patch.yml
↓
--patch overlay
De effectieve boom is te inspecteren met:
dsh --profile web --dump-config
Dit is nuttig voor teams die hun eigen agentplatform willen bouwen zonder upstream source te forken.
Web UI
De officiële quick start:
npx @deepseek-ai/dsh web
Standaard draait de Web UI lokaal op:
http://127.0.0.1:3080
Na configuratie van model en workspace kan de agent bestanden lezen en bewerken, commands draaien, taken delegeren en een plan bijhouden.[5]
Niet gebonden aan DeepSeek-modellen
Settings → Models ondersteunt meerdere providers.[4]
De officiële docs noemen onder andere:
- Anthropic,
- OpenAI,
- Amazon Bedrock,
- Google Vertex,
- Azure,
- Codex,
plus custom providers voor bedrijfs-gateways, self-hosted servers en OpenAI-compatible endpoints.[4]
Dus:
DeepSeek Harness ≠ DeepSeek-model-only
Eigen modellen via een LLM adapter
ctx.llm is een adapterregistry.[3][4]
Een adapter volgt bijvoorbeeld:
class MyAdapter extends LlmAdapter {
async *stream(options) {
// provider implementation
}
}
en vertaalt:
Harness request
↔
provider-API
Model wijzigen zonder serverrestart
Provider- en modelwijzigingen zijn volgens de guide bruikbaar bij de volgende request zonder Web UI restart.[4]
Het gekozen model wordt default voor nieuwe sessions.
Een session die al een request uitvoerde behoudt het model dat in het log is vastgelegd.[4]
Vier runtime modes
DeepSeek beschrijft vier hoofdmodi.[1]
Standard
Volledige coding agent met file editing, shell, file/web search, skills, planning, goals, subagents en workflows.
Code
Bevat Standard, maar exposeert tools via Code Mode SDK zodat het model meerdere operaties in één TypeScript-programma kan combineren.[1]
Minimal
persistent bash
str_replace_editor
Onder andere bedoeld voor modelbenchmarking met een minimale tool surface.[1]
Creator
Voor runtime inspection, plugin-experimenten en custom presets.[1]
Append-only session log
DeepSeek zegt dat alles wat het model ziet in een append-only session log wordt opgeslagen.[1]
Daaronder vallen system prompts, reasoning, tool calls/results, subagent scheduling en context injections.[1][3]
Resume, fork, search en replay gebruiken dezelfde event stream.
“Model-visible means logged”
De documentatie formuleert:
Model-visible means logged.
Alles dat naar een modelrequest gaat, moet uit het session log reconstrueerbaar zijn.
Dat helpt bij audit, debugging en analyse van agentgedrag.
Subagents als capability
ctx.subagents is een providerregistry.[8]
Gedocumenteerde providers zijn:
spawn-in-process
fork
ACP
Codex
Claude Code
dsh-sdk
De parent agent kan dus delegeren via één interface zonder de interne child runtime te kennen.
DSH kan echte Codex starten
De gedocumenteerde provider:
@deepseek-ai/dsh-subagent-codex
is niet slechts een HTTP-call naar een OpenAI-model.[9]
Hij start het echte Codex-product als proces.
De beschreven implementatie resolveert:
@openai/[email protected]
en communiceert via app-server --stdio.[9]
Elke call krijgt een vers proces, ephemeral thread en one-shot task.
Ook echte Claude Code kan child zijn
Een first-party sibling provider integreert Claude Code.[8][9]
Patroon:
task
→ subagent provider
→ Claude Code
→ final result
De child krijgt een zelfstandige taak en workspace, maar niet automatisch de volledige parent conversation.[9]
Daarom is de simpele vergelijking onvolledig
In plaats van:
DSH vs Claude Code vs Codex
is dit accurater:
DeepSeek Harness
├── eigen runtime
├── model providers
├── Claude Code als child
└── Codex als child
DSH kan dus concurrent én orchestrator zijn.
Daar staat meer configuratie, meer processen en een grotere attack surface tegenover.
Agent Teams is experimenteel
Het repository bevat Agent Teams met durable roster, task board, mailbox en child sessions.[3]
De docs noemen dit echter een experimental private opt-in coordination seam.[3]
Het moet niet worden gepresenteerd als een stabiele kern-API.
DeepSeek Harness vs Claude Code
Claude Code is een afgewerkt coding-agentproduct gericht op software engineering.
Het kan codebases verkennen, bestanden wijzigen, commands en tests uitvoeren, Git gebruiken en via MCP integreren.[12]
Belangrijk verschil:
Claude Code = codingproduct
DSH = composable framework/runtime
Het Claude Code repo vermeldt dat gebruik onder Anthropic Commercial Terms valt.[12]
DeepSeek Harness vs OpenAI Codex
Belangrijke correctie: Codex CLI is ook open source.
Het openai/codex repository gebruikt:
Apache-2.0
DSH is dus niet “de open-source variant van een gesloten Codex”.
Codex is vooral een coding-agentplatform met CLI, IDE, desktop, cloud, sandboxing, approvals en network policies.[13]
DSH is explicieter een compositielaag voor eigen agentruntimes en kan Codex zelf als child starten.[9]
DeepSeek Harness vs Muse Code
Meta lanceerde Muse Code op 5 augustus 2026 als beta terminal coding agent met Muse Spark 1.2.[14]
Muse Code en het model werden samen getraind rond planning, tool use, context compaction, subagents en lange software-engineeringtaken.[14]
Architectonisch:
Muse = model + harness samen geoptimaliseerd
DSH = model en capabilities maximaal vervangbaar
Vergelijkingstabel
| Functie | DeepSeek Harness | Claude Code | OpenAI Codex | Muse Code |
|---|---|---|---|---|
| Hoofdkarakter | framework/runtime | coding agent | coding agent/platform | coding agent |
| Status | developer preview | product | product | beta |
| Harness-licentie | MIT | Commercial Terms | Apache-2.0 | niet als vergelijkbaar open framework gepresenteerd |
| Multi-model by design | Ja | vooral Claude | vooral OpenAI | Muse Spark |
| Custom provider | Ja | integraties/gateways | OpenAI-ecosysteem | geen vergelijkbare laag beschreven |
| Web UI | Ja | vooral terminal/IDE | CLI, IDE, desktop, cloud | terminal |
| Headless | Ja | Ja | Ja | CLI |
| Plugin-first core | Ja | niet in dezelfde mate | niet in dezelfde mate | niet in dezelfde mate |
| Vervangbare agent loop | Ja | niet als centraal contract | niet als centraal contract | niet als centraal contract |
| Subagents | Ja | Ja | Ja | Ja |
| Claude Code child | Ja | N/A | geen hoofddoel | Nee |
| Codex child | Ja | geen hoofddoel | N/A | Nee |
| Officiële not production-ready warning | Ja | Nee | Nee | Beta |
Dit is een productvergelijking, geen intelligentieranking.
Waarom geen percentagebenchmark?
We vonden geen publieke test die tegelijk constant houdt:
zelfde model
zelfde prompt
zelfde repository
zelfde tools
zelfde sandbox
zelfde budget
zelfde tijd
zelfde grading
Opus + Claude Code vergelijken met een DeepSeek-model + DSH meet meerdere variabelen tegelijk.
Hoe benchmark je een harness eerlijk?
Test A: hetzelfde model
zelfde model + DSH
vs
zelfde model + minimale harness
Dit is beter om runtime-effecten te isoleren.
Test B: end-to-endproduct
Claude + Claude Code
OpenAI + Codex
Muse Spark + Muse Code
gekozen model + DSH
Meet task completion, tests, kosten, tijd, tool calls, menselijke interventies, regressies, out-of-scope changes, security incidents en restart recovery.
Security is de belangrijkste sectie
Het officiële SAFETY.md is direct.[6]
DSH kan model-generated code en commands uitvoeren, third-party plugins laden en toegang krijgen tot netwerk, processen, credentials en bestanden.
Foute modeloutput, bugs, misconfiguration, malicious input of untrusted plugins kunnen bestanden wijzigen of verwijderen, data lekken of de host beschadigen.[6]
Sandbox garandeert geen isolatie
DeepSeek schrijft:
Sandboxing, approval prompts, and permission controls can reduce risk, but they do not guarantee isolation or prevent damage.[6]
Aanbevolen zijn least privilege, disposable VM/container, backups, minimale secrets en review van plugins/config/commands.
DSH mag niet de enige security control voor onbetrouwbare workloads zijn.
Local-first is niet local-only
De Data Processing Statement noemt Harness local-first.[7]
Standaard worden inputs, outputs, session context, tool records, attachments, file paths en runtime logs lokaal opgeslagen.
Maar externe models, web tools, MCP servers en plugins kunnen data naar hun eigen providers sturen.[7]
local-first ≠ local-only
Telemetry is genuanceerder dan aan/uit
Telemetrygedrag veranderde in augustus.[16]
FULL vereist expliciete configuratie. Verse profiles sturen niet automatisch volledige session logs zonder actieve keuze, terwijl feedback afhankelijk van mode een beperktere reportingroute kan activeren.[16]
De Data Processing Statement noemt bovendien mogelijke geanonimiseerde configuratie-informatie en project lists met mogelijkheid om reporting uit te schakelen of endpoint te wijzigen.[7]
Controleer daarom altijd de concrete versie en configuratie.
Developer preview betekent echte breaking changes
De README waarschuwt:
THERE WILL BE COMPATIBILITY-BREAKING CHANGES.
In augustus volgden RC-versies elkaar snel op tot 0.1.1-rc.2.[10]
GitHub Discussions bevat ook communitymeldingen over npm dist-tags die rond rc.2 niet voor alle pluginpackages gelijk liepen.[15]
Dat is geen officiële bevestiging dat iedere installatie geraakt is, maar het past bij de upstream preview-warning.
Nu al plugins bouwen?
Voor R&D: ja, als churn acceptabel is.
Officiële extension points bestaan voor tools, LLM adapters, settings cards, capabilities, conversation nodes, storage, filesystem, sandbox en subagent providers.[3][4]
Voor teams die meerjarige API-stabiliteit vereisen is het huidige stadium vroeg.
Voor wie is DSH interessant?
Agent platform teams
Voor interne agentplatforms die niet aan één modelvendor gebonden willen zijn.
AI infrastructure R&D
Voor experimenten met loops, context policies, routing, subagentstrategieën en sandboxproviders.
Multi-modelorganisaties
Als control plane voor DeepSeek, Anthropic, OpenAI, interne gateways en self-hosted modellen.
Benchmarking
Minimal mode kan de tool surface sterk reduceren.[1]
Wanneer liever Claude Code, Codex of Muse Code?
Claude Code als je een volwassen coding agent in het Claude-ecosysteem wilt.
Codex als je CLI, IDE, desktop en cloud in het OpenAI-ecosysteem wilt met volwassen sandbox- en governancefuncties.[13]
Muse Code als je een co-trained combinatie van Muse Spark 1.2 en harness met background agents zoekt.[14]
DeepSeek Harness als je primair:
een eigen harness wilt bouwen
in plaats van alleen een kant-en-klare agent te gebruiken
Checklist voor productie
Versie en supply chain
- Pin een exacte
@deepseek-ai/dshversie. - Controleer scope
@deepseek-ai. - Controleer upstream repository.
- Gebruik geen onbekende wrappers als upstreamvervanger.
- Pin pluginversies.
- Controleer CLI/plugincompatibiliteit.
Runtime
- Dedicated user.
- Minimale workspace.
- Secrets buiten workspace.
- Backups.
- Approval voor destructieve commands.
- Network access beperken.
- Sandbox negatief testen.
- Sandbox nooit als perfecte grens zien.
Modellen
- Weet welke provider code ontvangt.
- Controleer retention policy.
- TLS/auth voor eigen gateway.
- API keys met minimale scope.
- Log model routing.
- Test meerdere modellen.
Plugins
- Review third-party plugins.
- Minimale capabilities.
- Vertrouw MCP servers expliciet.
- Review Skills als code.
- Geen auto-updates zonder review.
Kwaliteit
- Acceptance tests.
- Agent voert tests uit.
- Final diff reviewen.
- Regressies meten.
- Kosten per succesvolle taak meten.
- Restart recovery testen.
- Heldere subagentgrenzen.
POLPROG-oordeel
DeepSeek Harness is een van de interessantste agentprojecten van augustus 2026, niet omdat DeepSeek simpelweg “zijn eigen Claude Code” heeft gemaakt.
Interessant is juist:
model = plugin
tools = plugins
sandbox = plugin
session log = plugin
subagent provider = plugin
agent loop = plugin
UI = plugin
En de parent agent kan echte Codex- en Claude Code-processen delegeren.[8][9]
De relevante vraag is niet:
Zal DeepSeek Harness Claude Code vervangen?
Maar:
Gaan bedrijven model en harness loskoppelen en een eigen control plane over meerdere agents bouwen?
Frontiermodellen veranderen snel. Een harness kan meerdere modelgeneraties overleven.
DeepSeek probeert een laag te bouwen waarin model, provider, sandbox, tool, agent loop en UI vervangbaar zijn.
Dat is architectonisch sterk.
Maar op 31 augustus 2026 is DSH nog developer preview. Upstream zegt zelf dat er geen security audit is geweest en dat het project niet production-ready is.[6]
Voor R&D en gecontroleerde POCs
Zeker evalueren.
Direct als basis voor kritieke productie
Nog niet zonder eigen hardening, sandboxing, version pinning, plugin review en volledige POC.
Het grootste voordeel van DSH is vandaag niet een “beter model”, maar de poging om het model niet langer het architectonische centrum van de hele agent te laten zijn.

