Kernpunten

  • SpaceXAI bracht op 12 augustus 2026 Grok 4.6 uit tegen dezelfde prijs als 4.5: 2 dollar per miljoen invoertokens, 6 dollar per miljoen uitvoertokens. Claude Fable 5 rekent op dezelfde eenheden 10 en 50 dollar.

  • De winst zit vooral in agentwerk. Op SpaceXAI's eigen agentbenchmarks springt het model van 54 naar 65,9 en van 47,1 naar 57,5, terwijl de algemene intelligentiescore vijf punten stijgt.

  • Het model is geen groter basismodel. SpaceXAI hield het fundament gelijk en stak de verbetering in natraining op agenttaken. Dat zegt meer over de komende twee jaar dan de prijs.

Inhoud

  1. Een prijsverschil van zeven keer

  2. De sprong zit in agentwerk

  3. Waar het model geen groter model werd

  4. Waar de rekening alsnog oploopt

  5. Wat dit betekent voor AI zonder vendor lock-in

  6. Veelgestelde vragen

Een prijsverschil van zeven keer

Neem een agent die per dag een miljoen invoertokens verwerkt en een kwart miljoen tokens terugschrijft. Een documentenstroom, een mailbox, een verzameling aanvragen. Bij de tarieven die SpaceXAI voor Grok 4.6 publiceert kost die dag 3,50 dollar. Bij Claude Fable 5, op de gepubliceerde tarieven van 10 dollar invoer en 50 dollar uitvoer, kost dezelfde dag 22,50 dollar.

Dat is geen marge, dat is een andere businesscase. En het interessante is niet dat er een goedkoop model bij is gekomen. Het interessante is dat dit model op de onafhankelijke intelligentie-index van Artificial Analysis op 61 uitkomt, waar Claude Fable 5 op 62 staat en Claude Opus 5 op 63. Eén punt verschil, tegen een zevende van de uitvoerprijs.

Een jaar geleden kocht je met een lagere prijs een merkbaar zwakker model. Dat verband is aan het oplossen.

De sprong zit in agentwerk

De algemene scores vertellen maar de helft. Grok 4.6 klom op diezelfde index van 56 naar 61, vijf punten. Op de agentbenchmarks die SpaceXAI zelf publiceert is de beweging groter: DeepSWE van 54 naar 65,9, APEX-Agents van 47,1 naar 57,5. Dat zijn de eigen cijfers van de maker, dus lees ze met de gebruikelijke korrel zout, maar de richting is eenduidig en consistent met wat onafhankelijk gemeten is.

Dat verschil tussen algemene en agentgerichte winst is precies waar het voor een bedrijf om draait. Een model dat vijf punten slimmer wordt op kennisvragen merk je nauwelijks. Een model dat een taak van vijftien stappen vaker tot het eind volhoudt zonder de draad kwijt te raken, merk je meteen: dat is het verschil tussen een agent die je durft los te laten op je aanvragenstroom en een agent die je elke ochtend nakijkt.

Waar het model geen groter model werd

Hier zit het deel dat in de meeste berichtgeving wegvalt. Grok 4.6 is een natrainingsupgrade van 4.5, geen nieuw basismodel. SpaceXAI liet het fundament staan en stak het werk in een langere aanvullende trainingsronde, opnieuw gegenereerde trainingstrajecten en versterkend leren in agentomgevingen. Het contextvenster bleef ook gelijk, op 500.000 tokens.

Ruim tien punten winst op agenttaken, zonder een groter model eronder.

Dat is de reden om dit bericht serieus te nemen, en niet de prijs. Het gangbare beeld is dat de volgende sprong komt van het volgende grote model, met de bijbehorende wachttijd en de bijbehorende rekening. Deze release laat zien dat de winst nu ook uit de laag erboven komt: hoe je een bestaand model traint op het soort werk dat je er daadwerkelijk mee doet. Die laag beweegt sneller en goedkoper dan het bouwen van fundamenten.

Voor wie AI inkoopt betekent dat een kortere houdbaarheid van elke modelkeuze. Niet één keer per anderhalf jaar iets nieuws, maar elk kwartaal een kandidaat die op jouw specifieke taak beter kan zijn dan wat je draait.

Waar de rekening alsnog oploopt

Twee dingen die het beeld bijstellen, allebei relevant zodra je verder komt dan een proef.

Het contextvenster van 500.000 tokens heeft een drempel op 200.000. Ga je daar met je prompt overheen, dan verdubbelt het tarief naar 4 dollar invoer en 12 dollar uitvoer, en dat hogere tarief geldt voor alle tokens in die aanvraag, niet alleen voor het deel boven de drempel. Een agent die een compleet dossier meestuurt, zit daar sneller overheen dan je denkt. Er is daarnaast een snelle variant tegen het dubbele tarief.

En het model is traag op gang. Artificial Analysis meet een tijd tot het eerste token van ruim 42 seconden, tegen een mediaan van bijna drie seconden bij vergelijkbare redeneermodellen. De doorvoer daarna is normaal, 67,6 tokens per seconde. Voor een agent die 's nachts een stapel aanvragen wegwerkt, maakt die aanloop niets uit. Voor een chatfunctie waar een klant op het antwoord zit te wachten, is het onbruikbaar.

Zo werkt "het goedkoopste model" in de praktijk bijna altijd: het antwoord hangt af van de vorm van jouw werk, niet van de tarievenpagina.

Wat dit betekent voor AI zonder vendor lock-in

De praktische les van deze release gaat niet over Grok. Als een natrainingsronde binnen één kwartaal ruim tien punten op agenttaken oplevert, dan is elke modelkeuze die je vandaag maakt over zes maanden een open vraag. Dat is geen reden om te wachten. Het is een reden om te bouwen op een manier waarop wisselen goedkoop is.

Concreet betekent dat drie keuzes bij de bouw. Zet een dunne laag tussen je applicatie en de aanbieder, zodat het model een instelling is en geen fundament. Bouw een eigen testset van taken uit je eigen werk, want een index van negen benchmarks zegt niets over jouw aanvraagformulieren. En houd je data en je promptversies bij jezelf, buiten de omgeving van de aanbieder.

Wie dat op orde heeft, kan een release als deze binnen een dag testen en desgewenst overstappen. Wie het niet op orde heeft, leest dit soort nieuws als ruis, en betaalt ondertussen zeven keer te veel voor werk dat een goedkoper model net zo goed doet. Wij bouwen standaard op die eerste manier; als je wilt weten wat er in jouw situatie voor nodig is, plan een kennismaking.

Veelgestelde vragen

Is Grok 4.6 beter dan Claude of GPT? Op de intelligentie-index van Artificial Analysis scoort Grok 4.6 een 61, gelijk met GPT-5.6 Sol, tegen 62 voor Claude Fable 5 en 63 voor Claude Opus 5. Die verschillen zijn klein. Het prijsverschil is dat niet. Welk model beter is voor jou hangt af van je taak, je latentie-eisen en de lengte van je prompts.

Wat kost Grok 4.6 per maand voor een mkb-bedrijf? Dat hangt volledig af van het volume. Reken met 2 dollar per miljoen invoertokens en 6 dollar per miljoen uitvoertokens, en let op de verdubbeling boven 200.000 tokens per aanvraag. Een agent die dagelijks een paar honderd documenten verwerkt, blijft doorgaans onder de honderd dollar per maand.

Kan ik zomaar overstappen van het ene model naar het andere? Als je applicatie rechtstreeks tegen de SDK van één aanbieder is gebouwd, kost een overstap ontwikkelwerk. Met een tussenlaag en een eigen testset is het een configuratiewijziging plus een testronde.

Is een Amerikaans model toegestaan onder de AVG en de EU AI Act? Dat hangt af van wat je verwerkt en waar. De vraag is niet welk model, maar welke gegevens je verstuurt, welke verwerkersovereenkomst eronder ligt en in welke regio de verwerking plaatsvindt. Dit vraagstuk staat los van de modelkeuze zelf.