Op 24 juli 2026 bracht Anthropic Claude Opus 5 uit, een nieuw model uit de hoogste Opus-klasse, vooral bedoeld voor complexe agentic coding, lange meerstapsprocessen en veeleisend enterprise-werk.[1]
De officiële naam is Claude Opus 5, niet “Claude Opus 5.0”. De API-identificatie is:
claude-opus-5
Opus 5 vervangt Claude Fable 5 niet als Anthropic’s krachtigste publiek beschikbare model. Anthropic positioneert het eerder als een model dat de mogelijkheden van Fable 5 benadert tegen een lagere prijs en met gematigde, niet de traagste, latency.[2]
Het belangrijkste nieuws voor gebruikers van Opus 4.8 is dat de basisprijs niet is gestegen:
- USD 5 per miljoen inputtokens,
- USD 25 per miljoen outputtokens.[3]
Tegelijkertijd introduceert Opus 5 standaard ingeschakelde adaptieve reasoning, het nieuwe hoogste effort-niveau max, een context van maximaal één miljoen tokens, maximaal 128.000 tokens standaardoutput en nieuwe mechanismen voor langlopende agents.[2][4]
Kernconclusie: Claude Opus 5 is vooral een grote upgrade voor teams die complete taken aan het model delegeren in plaats van losse codefragmenten. Niet elke toepassing profiteert echter van migratie, omdat Sonnet 5 aanzienlijk goedkoper blijft en Fable 5 de hoogste positie in het aanbod behoudt voor maximale capability.
De informatie en documentatie zijn gecontroleerd op 24 juli 2026.
TL;DR
| Vraag | Antwoord |
|---|---|
| Wanneer verscheen het model? | 24 juli 2026 |
| Wat is de officiële naam? | Claude Opus 5 |
| Wat is de API-ID? | claude-opus-5 |
| Wat kost het? | USD 5 / MTok input en USD 25 / MTok output |
| Is de prijs hoger dan bij Opus 4.8? | Nee |
| Hoe groot is de context? | 1 miljoen tokens |
| Wat is de standaard maximale output? | 128.000 tokens |
| Is reasoning standaard ingeschakeld? | Ja |
| Welke effort-niveaus ondersteunt het? | low, medium, high, xhigh, max |
| Vervangt het Fable 5 als krachtigste model? | Nee |
| Verdwijnt Opus 4.8? | Nee, het blijft beschikbaar |
| Waar is het beschikbaar? | Claude, Claude Code, API, AWS, Google Cloud en Microsoft Foundry |
| Is er een Fast mode? | Ja, als research preview |
| Zijn alle benchmarks onafhankelijk? | Nee, de meeste resultaten rond de lancering komen van Anthropic of partners |
1. Wat is Claude Opus 5?
Anthropic beschrijft Opus 5 als een model voor:
- complexe agentic coding,
- werk aan grote repositories,
- lange tool-use-lussen,
- het oplossen van meerstapsproblemen,
- analyse van documenten en data,
- kantoorwerk,
- coördinatie van meerdere agents,
- het bouwen en verbeteren van interfaces en visueel materiaal.[4]
Opus 5 staat tussen Sonnet 5 en Fable 5:
Sonnet 5
Sneller en goedkoper model voor werk op schaal
Opus 5
Model voor moeilijke agentic- en enterprise-taken
Fable 5
Anthropic's hoogste publiek beschikbare capability
Anthropic adviseert Opus 5 als startpunt voor complexe agentic coding en enterprise-werk. Fable 5 is bedoeld voor situaties waarin de hoogst beschikbare capability de hogere prijs rechtvaardigt.[2]
2. Belangrijkste technische specificaties
| Parameter | Claude Opus 5 |
|---|---|
| API-ID | claude-opus-5 |
| Context | 1.000.000 tokens |
| Standaard maximale output | 128.000 tokens |
| Reasoning | Adaptief, standaard ingeschakeld |
| Effort-niveaus | low, medium, high, xhigh, max |
| Inputprijs | USD 5 / MTok |
| Outputprijs | USD 25 / MTok |
| Batch API-prijs | USD 2,50 / MTok input, USD 12,50 / MTok output |
| Fast mode | USD 10 / MTok input, USD 50 / MTok output |
| Reliable knowledge cutoff | mei 2026 |
| Training data cutoff | mei 2026 |
| Afbeelding als input | ja |
| Tekst als output | ja |
De gegevens over context, prijzen en cutoffs komen uit Anthropic’s officiële modeloverzicht en prijsdocumentatie.[2][3]
Eén miljoen tokens is standaard
Bij Opus 5 is één miljoen tokens zowel de standaard- als maximumcontext. Er bestaat geen aparte variant met een kleinere context.[4]
Dit betekent niet dat elk detail uit een zeer lange prompt met dezelfde nauwkeurigheid wordt gebruikt. Maximale capaciteit garandeert geen perfecte retrieval, reasoning of herinnering van ieder detail.
Standaardoutput tot 128.000 tokens
Standaardaanroepen van Messages API kunnen maximaal 128.000 tokens genereren. Anthropic documenteert daarnaast experimentele output tot 300.000 tokens voor Message Batches API met de juiste beta-header.[5]
Geschikte toepassingen zijn onder meer:
- zeer lange documentatie,
- uitgebreide data-extractie,
- grote code-scaffolds,
- boeklange concepten,
- lange reasoning-processen.
Een antwoord van deze omvang kan langer dan een uur duren en is niet beschikbaar via de gewone synchrone Messages API.[5]
3. Thinking is nu standaard ingeschakeld
Dit is een van de belangrijkste migratiewijzigingen.
Bij Opus 4.8 werkte een request zonder thinking zonder extra reasoning. In Opus 5 start hetzelfde request adaptieve reasoning. Het model bepaalt zelf wanneer en hoe lang het een probleem analyseert.[4]
Voorbeeld:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=16_000,
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Analyseer de projectarchitectuur en stel een migratieplan op."
}
],
)
print(response.content)
Dit hoeft niet te worden toegevoegd:
thinking={"type": "adaptive"}
omdat dit al het standaardgedrag is. Een expliciete instelling blijft ondersteund.
Vijf effort-niveaus
Opus 5 ondersteunt:
low
medium
high
xhigh
max
max is het hoogste test-time-compute-niveau en vereist geen beta-header.[4]
Een hogere effort kan kwaliteit verhogen bij moeilijke taken, maar betekent meestal ook:
- meer tokenverbruik,
- hogere kosten,
- langere wachttijd,
- meer tooloperaties,
- meer werk door subagents.
Daarom moet max niet automatisch voor elk request worden gebruikt.
4. Wanneer kan thinking worden uitgeschakeld?
Opus 5 staat het uitschakelen van thinking alleen toe bij:
low,medium,high.
De combinatie:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "xhigh"}
}
of:
{
"thinking": {"type": "disabled"},
"output_config": {"effort": "max"}
}
geeft HTTP 400.[4]
Dit is een breaking change ten opzichte van Opus 4.8.
Anthropic waarschuwt ook dat Opus 5 met thinking uitgeschakeld soms:
- een tool call als gewone tekst kan schrijven in plaats van als
tool_use-blok, - interne XML-markers in het zichtbare antwoord kan opnemen.
Anthropic adviseert thinking ingeschakeld te laten en kosten via lagere effort te beheersen, tenzij de integratie ander gedrag vereist.[4]
5. Wat is werkelijk verbeterd ten opzichte van Opus 4.8?
Volgens Anthropic’s documentatie gaan de belangrijkste verbeteringen over:
- diep reasoning,
- agentic coding,
- langlopende taken,
- kwaliteitsgroei met effort,
- code review en bugdetectie,
- visuele analyse,
- lange context,
- documenten, spreadsheets en presentaties,
- multi-agentcoördinatie.[4]
Langere taken en minder onafgemaakt werk
Anthropic stelt dat Opus 5 het doel beter vasthoudt tijdens lange tool-lussen en vaker afrondt:
- features over meerdere bestanden,
- grote refactors,
- end-to-end-taken,
- werk met testen en verificatie.
De leverancier wijst op minder placeholders en onvoltooide fragmenten.[4]
Automatische verificatie
Opus 5 controleert zijn eigen werk vaker. De migratiedocumentatie adviseert zelfs om herhaalde instructies te verwijderen, zoals:
Controleer je werk altijd aan het einde.
Gebruik een aparte subagent voor review.
Deze instructies kunnen leiden tot overmatige verificatie, extra tool calls en onnodige kosten.[4]
Meer delegatie naar subagents
In multi-agentomgevingen splitst en delegeert het model taken vaker. Dat kan nuttig zijn, maar vereist:
- budgetlimieten,
- monitoring van call-aantallen,
- controle van toolrechten,
- bescherming tegen gelijktijdige bewerking van dezelfde bestanden.
6. Benchmarks: wat kondigde Anthropic aan?
Bij de lancering meldde Anthropic zijn sterkste resultaten voor programmeren en knowledge work, waaronder Frontier-Bench en GDPval-AA.[1]
De juiste context is noodzakelijk:
- sommige tests zijn intern,
- de leverancier of partner koos configuratie en harness,
- resultaten kunnen afhangen van effort,
- kosten per taak hangen af van tokengebruik,
- niet elke benchmark is publiek eenvoudig reproduceerbaar,
- het zijn geen onafhankelijke kwaliteitscertificaten.
Frontier-Bench v0.1
Anthropic beweert dat Opus 5:
- eerste staat in Frontier-Bench v0.1,
- meer dan dubbel zo hoog scoort als Opus 4.8,
- dit doet tegen lagere kosten per taak.[1]
Een voetnoot vermeldt dat het een interne run was met mini-SWE-agent, een GKE-backend en een gemiddelde van vijf pogingen per taak. Bij weigeringen van de safety classifier werd Opus 4.8 als fallback gebruikt.[1]
Deze methodologische beperking hoort bij het resultaat.
CursorBench 3.2
Bij effort max zou Opus 5 binnen 0,5 procentpunt van Fable 5’s beste resultaat komen, tegen ongeveer de helft van de kosten per taak.[1]
Dit is nuttig voor prijs-kwaliteit, maar de test werd gepubliceerd door Anthropic en een partner, niet door een neutrale instelling.
ARC-AGI 3
Anthropic meldt een resultaat van ongeveer drie keer het volgende model in de tabel.[1]
Dat betekent niet “drie keer intelligenter”. De benchmark meet een specifiek type nieuwe probleemoplossing, geen algemene intelligentie.
Zapier AutomationBench
Volgens Anthropic was de pass rate van Opus 5 ongeveer 1,5 keer hoger dan van het volgende model bij vergelijkbare kosten. Zelfs de laagste effort zou meer taken hebben gehaald dan de andere modellen.[1]
OSWorld 2.0
In de computer-use-benchmark zou Opus 5 de beste verhouding tussen prestaties en kosten hebben en Fable 5’s beste resultaat overtreffen voor iets meer dan een derde van de kosten.[1]
Wetenschappelijk onderzoek
Anthropic rapporteert verbeteringen ten opzichte van Opus 4.8 in alle eigen life-sciences-evaluaties, waaronder:
- 10,2 procentpunt in een interne test voor het afleiden van moleculaire structuren uit spectroscopische data,
- 7,7 procentpunt in taken die het functionele effect van veranderingen in eiwitsequenties voorspellen.[1]
Dit zijn interne resultaten van de leverancier, geen onafhankelijke klinische of wetenschappelijke validatie.
7. Opus 5 vs Opus 4.8
| Kenmerk | Opus 4.8 | Opus 5 |
|---|---|---|
| Basisprijs | USD 5 / 25 per MTok | USD 5 / 25 per MTok |
| Context | tot 1M tokens | standaard 1M |
| Maximale output | 128k | 128k |
| Thinking zonder configuratie | uitgeschakeld | adaptief ingeschakeld |
| Hoogste effort | lager bereik | max |
| Minimale prompt-cachelengte | 1.024 tokens | 512 tokens |
| Tools wijzigen tijdens gesprek | geen nieuwe functie | beta |
| Automatische fallback per weigering | geen nieuwe modus | beta |
| Fast-modeprijs | USD 10 / 50 | USD 10 / 50 |
| Status | nog actief | nieuwste Opus |
Opus 4.8 is niet uitgefaseerd. Volgens de officiële planning blijven beide modellen actief en wordt Opus 5 niet vóór 24 juli 2027 uitgefaseerd.[6]
Wanneer bij Opus 4.8 blijven?
Dat kan zinvol zijn wanneer:
- bestaande prompts en agents nauwkeurig zijn afgestemd,
- regressietests nog niet zijn afgerond,
- de toepassing verwacht dat thinking zonder expliciete configuratie uitstaat,
- een stabiele bekende antwoordstijl nodig is,
- Opus-5-classifiers legitieme cybersecurityworkflows blokkeren,
- migratie geen meetbare kwaliteitswinst geeft.
8. Opus 5 vs Sonnet 5
| Kenmerk | Sonnet 5 | Opus 5 |
|---|---|---|
| Profiel | snelheid en intelligentie op schaal | moeilijke agentic- en enterprise-taken |
| Standaardprijs | USD 3 / 15 per MTok | USD 5 / 25 per MTok |
| Promotieprijs Sonnet | USD 2 / 10 tot 31 augustus 2026 | geen vergelijkbare actie |
| Context | 1M | 1M |
| Maximale output | 128k | 128k |
| Thinking | adaptief | adaptief |
| Latency volgens Anthropic | snel | gematigd |
| Hoogste effort | lager dan volledige Opus-schaal | max |
Sonnet 5 past beter bij:
- veel verkeer,
- frequente korte taken,
- kostenprioritaire automatisering,
- standaard codegeneratie,
- classificatie en extractie,
- toepassingen die lagere latency vereisen.
Opus 5 is logischer wanneer een verkeerde of onvoltooide taak duurder is dan extra tokens.
9. Opus 5 vs Fable 5
| Kenmerk | Opus 5 | Fable 5 |
|---|---|---|
| Positie | moeilijke agentic coding en enterprise | hoogste publiek beschikbare capability |
| Prijs | USD 5 / 25 | USD 10 / 50 |
| Context | 1M | 1M |
| Maximale output | 128k | 128k |
| Latency volgens Anthropic | gematigd | langzamer |
| Thinking | adaptief | altijd ingeschakeld |
| Vereiste dataretentie | geen bijzondere eis voor gewone toegang | 30 dagen vereist in API |
| Cyberbeveiliging | minder restrictief | aanzienlijk sterkere classifiers |
Anthropic presenteert Opus 5 als een model dat Fable 5 benadert tegen de helft van de prijs.[1]
Dat betekent niet dat Opus 5 altijd gelijkwaardig is. De officiële documentatie noemt Fable 5 nog steeds Anthropic’s meest capabele breed beschikbare model.[2]
Waar kan Opus 5 praktischer zijn?
- dagelijks programmeerwerk,
- code review,
- grote refactors,
- enterprise-workflows,
- documentanalyse,
- legitieme cybersecurity met minder weigeringen,
- situaties waarin Fable te duur is.
10. Nieuwe functies voor agents en API
Tools wijzigen tijdens een gesprek
In beta kunnen tools tussen turns worden toegevoegd of verwijderd zonder prompt cache ongeldig te maken.[4]
Benodigde header:
mid-conversation-tool-changes-2026-07-01
Dit is nuttig wanneer een agent:
- begint met analysetools,
- later repositorytoegang krijgt,
- eindigt met alleen test- en deploymenttools.
Zo kunnen rechten beperkt blijven.
Automatische fallbacks
De parameter fallbacks kreeg een modus "default", waarin Anthropic een vervangend model kiest per weigeringstype.[4]
De beta vereist:
server-side-fallback-2026-07-01
In Anthropic-toepassingen kunnen sommige geblokkeerde cyberverzoeken naar Opus 4.8 worden doorgestuurd. Een vergelijkbaar mechanisme kan in de API worden ingeschakeld.[1]
Kortere prompts kunnen cache gebruiken
De minimumlengte daalde van:
1.024 tokens in Opus 4.8
naar
512 tokens in Opus 5
Dit kan herhaalde system prompts en middelgrote agentinstructies goedkoper maken.[4]
11. Fast mode
Opus 5 heeft Fast mode als research preview.
Anthropic zegt dat het model daarin ongeveer 2,5 keer sneller werkt dan in standaardmodus.[1]
Prijs:
- USD 10 per miljoen inputtokens,
- USD 50 per miljoen outputtokens.[3]
Dat is twee keer de basisprijs.
Fast mode is beschikbaar via Claude API en usage credits in Claude Code. Volgens de documentatie is het nog niet beschikbaar via Amazon Bedrock, Google Cloud of Microsoft Foundry.[4]
Gebruik het alleen als lagere latency echte bedrijfswaarde heeft, bijvoorbeeld bij:
- interactief pair programming,
- incident response,
- code review op aanvraag,
- urgente analyses,
- human-in-the-loop-agents.
12. Veiligheid en beperkingen in cybersecurity
Anthropic zegt dat Opus 5 de grens bij de riskantste dual-use-capabilities niet verlegt en achter Mythos 5 blijft in biologie en offensieve cybersecurity.[1]
Anthropic trainde Opus 5 bewust niet direct op cybertaken. Het model verbeterde toch in kwetsbaarheidsdetectie als gevolg van bredere capabilitygroei.
Volgens Anthropic:
- benadert Opus 5 Mythos 5 in het vinden van kwetsbaarheden,
- blijft het veel zwakker bij het maken van werkende exploits,
- gebruikt het vergelijkbare safety classifiers als Opus 4.8,
- heeft het sterkere beveiliging voor een smalle categorie cybertaken.[1]
Wat kan worden geblokkeerd?
Anthropic noemt onder meer:
- binaire vulnerability scanning,
- sommige penetration tests,
- exploitgeneratie.
Nuttige toepassingen, zoals kwetsbaarheden vinden in broncode, moeten beschikbaar blijven.[1]
Anthropic schat dat Opus-5-classifiers ongeveer 85% minder vaak ingrijpen dan Fable-5-beveiliging. Dit is een leveranciersprognose, geen onafhankelijke meting.[1]
Geverifieerde organisaties en onderzoekers kunnen via het Cyber Verification Program toegang krijgen tot een minder beperkte variant.
13. Wat zegt Anthropic over alignment?
In Anthropic’s geautomatiseerde gedragsaudit behaalde Opus 5 een score van 2,3 voor algemeen misaligned gedrag. Anthropic noemt dit de laagste score onder zijn recente modellen.[1]
Volgens Anthropic:
- volgt het model Claude Constitution beter,
- gedraagt het zich minder vaak misleidend,
- is het moeilijker tot misbruik te bewegen,
- voert het minder vaak riskante, moeilijk terug te draaien acties uit.
Het is een audit van de leverancier. Het resultaat betekent niet dat het model onfeilbaar, volledig veilig of bestand tegen iedere prompt injection is.
14. Beperkingen van Claude Opus 5
Het kent niet alles na mei 2026
Reliable knowledge cutoff en training data cutoff zijn mei 2026.[2]
Voor latere informatie zijn nodig:
- websearch,
- actuele databases,
- tools,
- documenten die in context worden aangeleverd.
Eén miljoen tokens garandeert geen perfect geheugen
Veel context voorkomt niet:
- weggelaten details,
- verkeerde interpretatie,
- conflicterende instructies,
- degradatie bij slecht georganiseerde context,
- afleiding door irrelevante documenten.
Standaard thinking maakt kosten minder voorspelbaar
Dezelfde prompt kan afhankelijk van probleem en effort een ander aantal tokens gebruiken. Meet daarom:
- inputtokens,
- outputtokens,
- cache hits,
- responstijd,
- tool calls,
- totale kosten per taak.
Langere antwoorden kunnen promptaanpassingen vereisen
De documentatie waarschuwt dat antwoorden en documenten langer kunnen zijn dan in Opus 4.8. Het model rapporteert ook vaker over voortgang.[4]
Voor korte resultaten zijn expliciete formaatlimieten nodig.
Benchmark is geen productie
Een sterke benchmark garandeert niet:
- correctheid in een private framework,
- kennis van interne API’s,
- naleving van bedrijfsstandaarden,
- afwezigheid van regressies,
- stabiele kosten,
- goede werking met een specifieke agent harness.
15. Veilig migreren vanaf Opus 4.8
Stap 1: wissel niet zonder tests
Bereid echte taken voor:
- bugfix,
- refactoring,
- code review,
- tests maken,
- documentanalyse,
- toolgebruik,
- long-horizon-taak.
Stap 2: wijzig de identifier
Vervang:
model = "claude-opus-4-8"
met:
model = "claude-opus-5"
Stap 3: controleer thinking
Als de oude integratie geen thinking stuurde, gaat het gemigreerde model adaptieve reasoning gebruiken.
Als thinking uit moet blijven, stel effort niet hoger in dan high.
Stap 4: verhoog max_tokens voor moeilijke taken
Thinking en antwoord delen één limiet. Een te lage waarde kan de taak eerder afbreken dan bij Opus 4.8.[4]
Stap 5: verwijder overbodige verificatie-instructies
Controleer of de prompt herhaalde reviews vereist die Opus 5 zelf al uitvoert.
Stap 6: meet de kosten van de volledige taak
Vergelijk:
kosten van een afgeronde taak
tijd tot correct resultaat
aantal iteraties
aantal tool calls
aantal handmatige correcties
Vergelijk niet alleen de prijs per miljoen tokens.
Stap 7: behoud een fallback
Opus 4.8 blijft actief en kan dienen als:
- fallback bij weigering door een classifier,
- bescherming tegen regressies,
- stabiel model voor bestaande prompts,
- alternatief voor specifieke cybersecurityworkflows.
16. Is overstappen naar Claude Opus 5 de moeite waard?
Ja, wanneer:
- een agent over veel bestanden werkt,
- het model lang zonder continue begeleiding moet werken,
- code review en subtiele bugs belangrijk zijn,
- je grote refactors uitvoert,
- het model veel tools en subagents gebruikt,
- je documenten, spreadsheets of presentaties maakt,
- Opus 4.8 taken vaak slechts gedeeltelijk afrondt,
- Fable 5 te duur is.
Niet noodzakelijk, wanneer:
- taken kort en herhalend zijn,
- Sonnet 5 voldoende kwaliteit levert,
- latency belangrijker is dan maximale nauwkeurigheid,
- regressietests nog ontbreken,
- de toepassing thinking uitgeschakeld nodig heeft bij maximale effort,
- cybersecurityworkflows worden geblokkeerd,
- kwaliteitswinst extra tokengebruik niet rechtvaardigt.
17. Oordeel
Claude Opus 5 is niet alleen “Opus 4.8 met een nieuw nummer”.
De belangrijkste wijzigingen gaan over de manier van werken:
- thinking is standaard ingeschakeld,
- effort
maxis beschikbaar, - het model verifieert resultaten vaker,
- lange en multi-file-taken gaan beter,
- subagents worden vaker gecoördineerd,
- dynamische tools en automatische fallbacks zijn toegevoegd,
- de prijs van Opus 4.8 blijft behouden.
Volgens de leveranciersinformatie kan Opus 5 een sterke verhouding tussen capability en kosten bieden bij moeilijke programmeer- en enterprise-taken. Het is niet altijd de beste keuze:
- Sonnet 5 blijft goedkoper,
- Fable 5 blijft Anthropic’s meest capabele breed beschikbare model,
- de meeste launchbenchmarks komen van Anthropic of partners,
- elke migratie vereist interne tests van kwaliteit, kosten en veiligheid.
De verstandigste strategie is routing:
Sonnet 5
voor snelle taken met hoog volume
Opus 5
voor moeilijke agentic- en meerstapsprocessen
Fable 5
voor de moeilijkste gevallen waarin maximale capability de kosten rechtvaardigt
18. Checklist voor ingebruikname
API
- Model-ID gewijzigd naar
claude-opus-5. - SDK-versie gecontroleerd.
-
max_tokensgecontroleerd. - Standaard thinking meegenomen.
- Thinking niet uitgeschakeld bij
xhighofmax. - HTTP-400-afhandeling getest.
- Fallback toegevoegd.
- Prompt cache gemeten.
- Regio en cloudprovider gecontroleerd.
Kwaliteit
- Interne evaluatieset voorbereid.
- Opus 5 vergeleken met Opus 4.8.
- Opus 5 vergeleken met Sonnet 5.
- Correcte taakafronding gemeten, niet alleen stijl.
- Grote repositories getest.
- Code review getest.
- Frontend en afbeeldingen getest.
- Lange documenten getest.
- Herhaalbaarheid over meerdere runs getest.
Kosten
- Inputtokens gemeten.
- Output- en thinkingtokens gemeten.
- Cache hits gemeten.
- Tool calls geteld.
- Totale taakkosten gemeten.
- Standaardmodus en Fast mode vergeleken.
-
low,medium,high,xhigh,maxvergeleken. - Budgetlimieten voor subagents ingesteld.
Veiligheid
- Toolrechten gecontroleerd.
- Destructieve bewerkingen beperkt.
- Productiewijzigingen vereisen goedkeuring.
- Prompt injection getest.
- Cybersecurityclassifiers getest.
- Logging en audit van de agent gecontroleerd.
- Zelfverificatie van het model niet als onafhankelijke audit behandeld.

