Alle edities

De AI Brief · week 29

GPT-5.6 zet de prijs-prestatiestrijd verder onder druk

Verder deze week: open-weight modellen worden serieuzere alternatieven, GitLost toont het risico van agents met te veel rechten en bedrijven zoeken grip op hun AI-kosten.

14 jul 2026 · de hele week · door een mens, AI als gereedschap

Waar staan we

De economische rekensom onder AI verandert snel. OpenAI maakte GPT-5.6 op 9 juli algemeen beschikbaar en legt bij de nieuwe familie sterk de nadruk op prestaties per dollar. Tegelijk worden open-weight modellen uit China serieuzere alternatieven voor programmeer- en agenttaken. Voor bedrijven ontstaat daardoor meer keuze, maar niet automatisch een lagere rekening.

Want zodra AI van experiment naar dagelijks werk verschuift, komen andere vragen boven: waar lopen de kosten op, welke gegevens geef je prijs en welke rechten krijgt een agent? GitLost liet deze week heel concreet zien hoe een agent met toegang tot private repositories via een openbaar issue kon worden misleid. De beweging van de week is daarom niet simpelweg "AI wordt goedkoper", maar: meer capaciteit per euro vraagt om scherper beheer.

Wat er deze week schoof

wat er nu kan

GPT-5.6 levert meer per dollar, maar de winst verschilt per taak

OpenAI maakte op 9 juli GPT-5.6 algemeen beschikbaar, na een beperkte preview voor geselecteerde partners. De familie bestaat uit Sol, Terra en Luna. De API-prijzen lopen van $5 input en $30 output per miljoen tokens voor Sol tot $1 en $6 voor Luna. OpenAI rapporteert duidelijke efficiëntiewinst, maar niet één universeel percentage: in een codingvergelijking gebruikte Sol minder dan de helft van de outputtokens, nam de taak minder dan de helft van de tijd in en lagen de geschatte kosten ongeveer een derde lager dan bij Claude Fable 5. Praktijkresultaten kunnen per taak sterk verschillen. De beperkte preview werd afgestemd met de Amerikaanse overheid, maar was geen formele overheidsgoedkeuring. OpenAI zegt zelf dat zo'n toegangsproces niet de vaste standaard moet worden. Ook meldde een Codex-gebruiker een contextlimiet van 372K tokens waar de modelspecificatie ongeveer één miljoen tokens noemt. Dat is een relevante productmelding, maar nog geen bewijs dat het model zelf slechts een derde van de geadverteerde context aankan; het kan ook om een product- of configuratielimiet gaan.

Herbereken je eigen taken. Vergelijk kwaliteit, doorlooptijd, inputtokens, outputtokens en totale kosten; neem geen benchmarkpercentage rechtstreeks over in je berekening.

voor wie het nakijkt

gpt-5-6, frontier, inference, cost

wat het kost

Open-weight modellen worden een serieuzere prijsoptie

GLM-5.2, DeepSeek V4 Preview en Kimi K2.7 laten zien hoe snel het aanbod buiten de Amerikaanse frontierlabs groeit. Z.ai presenteert GLM-5.2 als een open model voor langlopende taken. Moonshot biedt Kimi K2.7 Code met een contextvenster van 256K tokens en API-prijzen van $0,95 per miljoen inputtokens en $4 per miljoen outputtokens. Zulke prijzen zetten druk op de markt, maar bewijzen nog niet dat deze modellen in iedere taak dezelfde kwaliteit leveren als een duurder vlaggenschip. Ook "open" betekent niet automatisch veilig voor gevoelige data. Dat voordeel ontstaat pas als je het model zelf host of bij een aanbieder draait met passende afspraken over locatie, logging, bewaartermijnen en training. Een goedkope externe API kan dezelfde gegevensrisico's hebben als iedere andere clouddienst.

Test een representatieve set van je eigen taken op minimaal twee modellen. Kies voor gevoelige data pas na een expliciete controle op hosting, logging en datagebruik.

voor wie het nakijkt

open-weights, china, cost, competition

werkt het echt

GitLost toont waarom agents minimale rechten nodig hebben

Noma Security beschreef GitLost, een indirecte promptinjectie in GitHub Agentic Workflows. Een aanvaller kon kwaadaardige instructies in een openbaar GitHub-issue zetten. Een agent die dat issue verwerkte en ook toegang had tot private repositories, kon vervolgens worden aangezet om private gegevens in een openbare reactie te plaatsen. Het incident bewijst niet dat iedere AI-agent per definitie onveilig is. Het laat wel zien dat de combinatie van onbetrouwbare invoer, gevoelige tools en ruime rechten gevaarlijk is. Een mens als laatste controle helpt, maar technische grenzen zijn minstens zo belangrijk: minimale rechten, scheiding tussen publieke en private context, allowlists voor tools en expliciete goedkeuring voordat gegevens worden gepubliceerd.

Geef een agent alleen toegang die nodig is voor de taak. Laat het lezen van externe inhoud nooit automatisch leiden tot het ophalen of publiceren van interne gegevens.

voor wie het nakijkt

agents, security, prompt-injection, permissions

wie aan de knoppen zit

Illinois maakt frontier-AI-regels concreter

De gouverneur van Illinois tekende op 6 juli SB 315, de Artificial Intelligence Safety Measures Act. De wet richt zich op ontwikkelaars van de grootste geavanceerde AI-systemen en vraagt onder meer om openbare veiligheidspraktijken, melding van ernstige incidenten, complianceprocessen, onafhankelijk toezicht en bescherming van klokkenluiders. Illinois noemt het een eerste en zeer beschermende staatswet. Belangrijker voor bedrijven is de richting: AI-governance gaat steeds vaker over aantoonbare processen en verantwoordelijkheden, niet alleen over vrijwillige principes. Dat betekent niet dat ieder MKB-bedrijf direct onder deze wet valt, maar leveranciers zullen hun product- en compliancebeleid erop moeten aanpassen.

Houd per AI-toepassing bij welk model en welke leverancier je gebruikt, welke gegevens erin gaan en wie verantwoordelijk is voor controle en incidenten.

voor wie het nakijkt

regulation, illinois, policy, accountability

hoe het voelt

AI-kosten groeien sneller dan het zicht erop

De opvallende ontwikkeling is niet dat bedrijven massaal stoppen met AI, maar dat kostenbeheersing achterloopt op de uitrol. KPMG meldt in zijn Q2 AI Pulse dat 35 procent van de ondervraagde leiders kostenmanagement en kennis van token- en inferenceprijzen als barrière ziet. Slechts 26 procent van de organisaties heeft realtime inzicht in AI-kosten en 36 procent gebruikt directe token- of gebruikslimieten. Satya Nadella wees deze week op een tweede economische vraag: bedrijven betalen niet alleen voor het model, maar voeden het gebruik ook met eigen kennis, correcties en werkprocessen. Zijn "Reverse Information Paradox" is geen bewijs dat iedere leverancier klantkennis misbruikt; het is een waarschuwing dat organisaties hun data, evaluaties, geheugen en de manier waarop ze AI aansturen bewust moeten beheren.

Meet per taak niet alleen licentiekosten, maar ook tokens, infrastructuur, menselijke controle, herstelwerk en de waarde van gedeelde bedrijfskennis.

voor wie het nakijkt

roi, cost, enterprise, governance

Deze week doen

Pak je duurste of meest gebruikte AI-taak en voer dezelfde tien representatieve taken uit op GPT-5.6 en één goedkoper alternatief. Leg per taak vast: kwaliteit, snelheid, inputtokens, outputtokens, totale kosten en benodigde menselijke correctie. Controleer daarnaast waar de verwerking plaatsvindt en of invoer voor training of productverbetering wordt gebruikt. Kies pas daarna het model.

Gereedschapskist

  • GPT-5.6 Sol, Terra en Luna · officiële introductie · drie prijs- en prestatieniveaus; geschikt om binnen één familie kosten en kwaliteit te vergelijken.
  • GLM-5.2 en Kimi K2.7 Code · GLM-5.2 · Kimi API · goedkopere alternatieven om op je eigen taken te testen; open-weight is geen automatische privacygarantie.
  • AI-kostenlog · noteer per taak model, tokens, prijs, doorlooptijd, correctietijd en foutkosten. Zonder deze gegevens is "goedkoper" vooral een aanname.

Wat ik volg

  • of de beperkte Amerikaanse toegang rond frontiermodellen uitgroeit tot een herhaalbaar vrijwillig proces, of juist een eenmalige uitzondering blijft.
  • of onafhankelijke benchmarks de prijs-prestatieclaims van de nieuwe open-weight modellen bevestigen op echte productietaken.
  • of het gemelde verschil tussen de GPT-5.6-modelcontext en de Codex-context een productlimiet, configuratiekwestie of fout blijkt.
  • hoe Illinois SB 315 wordt uitgevoerd en welke andere staten vergelijkbare audit- en transparantie-eisen invoeren.

Mijn voorspellingen

  • "China haalt de bodem onder flagship-pricing weg" · bewijs stapelt · officiële prijzen van onder meer Kimi en het tempo van nieuwe open-weight releases vergroten de prijsdruk · sinds 2026-W18
  • "Een open-weight model staat voor eind W36 in de top-3 van een relevante codingbenchmark" · open · nieuwe modellen zijn competitief, maar onafhankelijke bevestiging blijft nodig · sinds 2026-W23
  • "AI-investeringen leveren nog niet op wordt een dominant mainstream-narratief" · open · kosteninzicht en economische kennis blijven volgens KPMG achter, terwijl investeringen vooralsnog op peil blijven · sinds 2026-W23
  • "Voor eind 2026-W40 verlaagt minstens één Amerikaans frontierlab de tokenprijs van een vlaggenschip met minstens 25 procent tegenover begin W29" · open · goedkopere modelvarianten en open-weight concurrentie voeren de druk op · sinds 2026-W29

Wat mij ongelijk zou geven

Mijn verwachting dat menselijke en technische controle noodzakelijk blijven, zou verzwakken als agents met brede tooltoegang aantoonbaar langdurig veilig en betrouwbaar functioneren zonder extra toezicht. GitLost wijst deze week juist de andere kant op: rechten en datastromen moeten vooraf technisch worden begrensd.

Essay-kandidaten

  • Je AI-agent is een nieuw beveiligingsoppervlak: GitLost als concreet voorbeeld van hoe onbetrouwbare invoer, private context en te ruime rechten samen een lek vormen.
  • Wie vangt de opbrengst als modellen goedkoper worden: de waarde verschuift van modeltoegang naar goede evaluaties, eigen data, procesontwerp en controle.

Wat ik je bespaar

  • losse socialmedia-claims over prijsverschillen zonder vergelijkbare taak, kwaliteit en tokenmeting.
  • spectaculaire securityclaims zonder technisch onderzoeksrapport of onafhankelijk bevestigde incidentanalyse.
  • uitspraken dat open modellen automatisch privé of veilig zijn zonder informatie over de hostingomgeving.
  • voorspellingen over verplichte overheidskeuringen zolang daar geen formele regeling of primaire bron voor bestaat.

Mijn voorspellingen

Wat ik denk dat er gaat gebeuren in AI, en hoe het uitpakt. Ook als ik ongelijk had.

2 bevestigd18 open0 weerlegd
Op korte termijn13
  • opensinds 2026-W26 · review na 2026-W34

    Voor eind 2026-W34 wisselt minstens een van de drie grote Amerikaanse labs (OpenAI, Anthropic, Google) opnieuw een frontier-model van publieke beschikbaarheid naar overheids- of toegangsbeperking

  • opensinds 2026-W25 · review na 2026-W40

    Voor eind 2026-W40 verwijst minstens een tweede EU-rechterlijke uitspraak, toezichthouder of officiele richtlijn naar het Duitse AI-Overviews-oordeel als grond voor directe aanbieder-aansprakelijkheid voor AI-output

    het bewijs

    W26: geen nieuwe juridische verwijzing; de EU stemde wel in met uitstel van enkele AI Act-verplichtingen, wat de richting eerder vertraagt dan versnelt

  • opensinds 2026-W24 · review na 2026-W40

    Werkgeheugen blijft duur (32GB DDR5 boven ~250 euro) tot eind 2026 door AI-datacentervraag, wat lokaal AI draaien minder goedkoop maakt dan de gratis open-weights suggereren

  • opensinds 2026-W23 · review na 2026-W36

    EU-gehoste of on-prem AI wordt voor eind W36 een expliciete inkoop- of architectuurfactor in minstens een gevoelige-data-sector (juridisch/zorg/finance) in NL/EU, gedreven door AI Act-agentregels (augustus) plus Europese compute

    het bewijs

    W26: de overheids-gating van GPT-5.6 en Mythos 5 maakte US-afhankelijkheid opnieuw tastbaar; zelf-draaibaar of binnen de EU verschoof van ideologie naar continuiteitsargument

  • opensinds 2026-W23 · review na 2026-W36

    Voor eind 2026-W36 staat een open-weights model (DeepSeek, Qwen of StepFun) in de top-3 van SWE-Bench Pro, op closed-flagship-niveau

    het bewijs

    bewijs stapelt W24: MiniMax M3 op 54.7 van de Artificial Analysis Intelligence-index (open, vlak onder flagship); W26: GLM-5.2 komt binnen als sterkste open model voor coding/agents, het bewijs blijft richting de W36-deadline stapelen

  • opensinds 2026-W23 · review na 2026-W52

    Voor eind 2026 voert minstens een mainstream NL/EU-merk 'door mensen gemaakt' of 'AI-vrij' actief als verkoopargument (label, campagne of premium-tier)

  • opensinds 2026-W23 · review na 2026-W52

    Voor eind 2026 wordt 'AI-investeringen leveren nog niet op' een dominant mainstream-narratief op cover-story-niveau, wat MKB voorzichtiger maakt

  • opensinds 2026-W23 · review na 2026-W52

    Voor eind 2026 bevestigt Apple publiekelijk dat de Gemini-Siri-inferentie via Apple's Private Cloud Compute loopt (niet rauw naar Google), als GDPR-relevant verkoopargument

    het bewijs

    beweegt sterk W24: Apple toont op WWDC een drie-lagen-Siri (toestel / Apple privacy-cloud / Google-cloud voor complexe taken), gerapporteerd 1,2T-Gemini ~1mld/jr, geen EU-launch; expliciete GDPR-framing ontbreekt nog

  • opensinds 2026-W23 · review na 2026-W52

    Voor eind 2026 draait een open MoE-model van Qwen of DeepSeek-V4-Flash-klasse (near-frontier reasoning) bruikbaar boven 20 tokens/sec lokaal op een Mac van maximaal 4000 euro

  • opensinds 2026-W22 · review na 2026-W34

    Kosten-per-taak wordt binnen 2 kwartalen de dominante AI-inkooplens bij MKB

  • opensinds 2026-W21 · review na 2026-W30

    Coding-tools-laag commoditiseert binnen ~12 maanden

  • bevestigdsinds 2026-W19 · review na 2026-W22

    AI inside zakt als verkoopargument, human-led stijgt

    het bewijs

    HN-top "I'm Tired of Talking to AI" (W22 1724pt naar W23 2008pt) + DuckDuckGo +28% + AI-vrij als feature; herbevestigd W23; herbevestigd W24: "AI is slowing down" 613pt + zelfbewuste anti-AI-vraag 455pt; herbevestigd W26: Ford haalt ervaren mensen terug bij z'n agent-uitrol, bouwers willen de code-review aanscherpen, en de "AI verbrandt de toast, ik schraap 'm af"-stemming

  • bevestigdsinds 2026-W18 · review na 2026-W22

    China haalt de bodem onder flagship-pricing weg

    het bewijs

    DeepSeek 75% korting permanent + Qwen Opus-niveau (W22); herbevestigd W23: DeepSeek-V4-Pro/Flash + Qwen3.6 voeren HF-trending aan (open-weights naderen flagship); herbevestigd W24: 25+ open modellen in 1 week, DeepSeek-V4-Pro #1 HF (4730), Google geeft Gemma 4 zelf open vrij; herbevestigd W26: Zhipu's open GLM-5.2 voert de open-model-ranglijst aan, juist nu de Amerikaanse topmodellen achter een overheidshek verdwijnen

~1 jaar6
  • opensinds 2026-W23 · review na 2027-W23

    Voor 2027-W23 wordt minstens een top coding-tool (Cursor, Copilot, Windsurf of Claude Code) overgenomen of fundamenteel van 'tool' naar 'platform/agent' herpositioneerd

  • opensinds 2026-W23 · review na 2027-W23

    Voor 2027-W23 brengt een grote partij (OpenAI, Anthropic, Google, Apple of Microsoft) een mainstream proactieve persoonlijke assistent die een fleet van agents aanstuurt

  • opensinds 2026-W23 · review na 2027-W52

    Voor eind 2027 haalt de METR 50%-task-horizon taken die mensen minstens een volledige werkdag (8 uur) kosten, voor generalist-agents

  • opensinds 2026-W23 · review na 2028-W22

    Voor 2028-W22 is er geen algemeen beschikbaar agent-product dat een NL-MKB-werknemerrol end-to-end vervangt met persistent leren over sessies, op productie-betrouwbaarheid (Karpathy continual-learning-test, human-moat-tracker)

  • opensinds 2026-W23 · review na 2027-W52

    Voor eind 2027 ziet minstens een traditioneel NL-kwaliteitsmerk (Volkskrant, NRC of FD) een meetbare opleving in betalende abonnees of print-oplage, mede gedreven door deepfake-/fake-news-moeheid en 'geverifieerd door mensen' als waarde (flight to verified-human)

  • opensinds 2026-W23 · review na 2027-W52

    Voor eind 2027 wordt parasociale AI-schade ('AI-psychose', ongezonde AI-afhankelijkheid) een erkende categorie in minstens een Westers land: een formele gezondheidsrichtlijn, klinische erkenning, of door een toezichthouder afgedwongen platform-maatregel

~3 jaar (horizon-watch)1
  • opensinds 2026-W23 · review na 2028-W52

    Voor eind 2028 publiceert minstens een frontier-lab een geverifieerde, reproduceerbare autonome verbetering door een AI aan z'n eigen training of architectuur boven menselijke baseline (Clark 60%-scenario)