Waarom het grootste deel van je AI-agent-code geen AI is
Microsoft heeft het raamwerk dat elk agentteam opnieuw bouwt als open source gepubliceerd — en de modellen evenaren al systemen die tien keer zo groot zijn.

- 98.4%
- van typische agentcode die infrastructuur is, geen AI-logica
- 69.7%
- SWE-bench Verified-score voor Orchard-SWE
- 68.4%
- gemiddeld succespercentage voor webtaken van Orchard-GUI
- ~3B
- parameters, vergelijkbaar met systemen tien keer zo groot
Op 3 augustus publiceerde Microsoft Research Orchard, een open-source framework om AI-agenten te trainen en te draaien — software die zelfstandig acties kan ondernemen, zoals code schrijven of op het web surfen, in plaats van alleen vragen te beantwoorden. Bijna elk team dat zoiets heeft gebouwd, stuit op dezelfde muur: het moeilijkste deel is niet de AI zelf.
Een analyse van echte productie-agentsystemen liet zien dat zo'n 98 procent van de code infrastructuur is — toolpermissies, geheugenbeheer, foutafhandeling en herstellogica — niet de eigenlijke beslissingslogica. Daar bovenop trainden de meeste teams hun agenten in vereenvoudigde testomgevingen die in niets leken op de echte tools die in productie worden gebruikt. Bij de echte inzet viel de prestatie dan ook tegen.
Orchard lost beide problemen op. Het biedt de infrastructuurlaag kant-en-klaar aan en laat agenten trainen direct in echte omgevingen — code-editors, webbrowsers, persoonlijke-assistent-apps — zodat wat ze leren ook in de praktijk standhoudt. De vroege resultaten zijn sterk: het Orchard-SWE-model scoorde 69,7 procent op SWE-bench Verified, een zwaar software-engineering-benchmark, met zo'n 3 miljard parameters, vergelijkbaar met systemen tien keer zo groot.
Voor elk team dat agenten bouwt — voor workflowautomatisering, klantvragen of een codeerassistent — neemt Orchard de noodzaak weg om die infrastructuur zelf te schrijven. Het is open source en vandaag beschikbaar op GitHub. Stop met het opnieuw bouwen van het raamwerk; Orchard heeft dat al gedaan.