Geschatte leestijd: 5 minuten
Inhoudsopgave
Jensen Huang heeft een test om te bepalen of een engineer het waard is om te houden, en er hangt een tokenbudget aan vast. In de All-In Podcast aan het einde van GTC 2026 zei de topman van Nvidia dat als het jaarlijkse AI-tokenverbruik van een engineer van 500.000 dollar onder de helft van dat salaris blijft, hij "diep verontrust" zou zijn. Nvidia werkt volgens hem toe naar een jaarlijkse tokenrekening van 2 miljard dollar voor zijn engineeringteam.
Hij beschreef een afweging die de meeste bedrijven met minder bombarie allang hebben gemaakt: geld dat ooit naar mensen ging, gaat steeds vaker naar tokens. De vier grootste hyperscalers stuurden aan op ruwweg 700 miljard dollar aan gecombineerde kapitaaluitgaven in 2026, bijna een verdubbeling ten opzichte van vorig jaar. Tegelijk laat data van outplacementbureau Challenger, Gray & Christmas zien dat AI voor de vierde maand op rij de meestgenoemde reden is voor ontslagen in de VS.
Een intern memo van Meta, in handen van Reuters, omschreef de schrapping van 8.000 functies in mei als een compensatie voor de forse investeringen van het bedrijf, in een kwartaal waarin de omzet met 33% groeide. Ontslagen bij dit soort bedrijven zijn geen overlevingsmaatregel. Het is financiering.
Het probleem is dat die financiering niet heeft opgeleverd wat ze beloofde. Gartner ondervroeg 350 bestuurders bij bedrijven met meer dan 1 miljard dollar omzet die allemaal AI-agents of automatisering inzetten, en vond dat ruwweg 80% personeel had geschrapt zonder enig verband met een beter rendement. Het oordeel van analist Helen Poitevin was hard: "Personeelsreducties maken misschien budget vrij, maar leveren geen rendement op."
Uber leerde de tokenkant van die les op de dure manier. Het gaf 5.000 engineers in december AI-programmeertools en had zijn hele AI-budget voor 2026 in april al opgesoupeerd. Chief Operating Officer Andrew Macdonald gaf toe dat de link met iets wat klanten merken ontbreekt, ondanks dat 70% van de aangeleverde code door AI werd gegenereerd: "Die verbinding is er nog niet."
Zet die twee mislukkingen naast elkaar en het echte probleem komt scherp in beeld. Bedrijven behandelden de tokenrekening als vast en het personeelsbestand als flexibel, terwijl het precies andersom is. Een bezuiniging op salarissen gebeurt eenmalig en neemt institutionele kennis mee de deur uit. Een tokenbudget blijkt op een stuk of zes plekken te buigen, als iemand de moeite neemt om het te engineeren.
Waar het tokenbudget buigt
De goedkoopste ingreep is ook de minst glamoureuze: stop met betalen om dezelfde tekst steeds opnieuw te verwerken. Prompt caching, inmiddels standaard bij de grote API-aanbieders, verlaagt de kosten van herhaalde invoer met tot 90% volgens de gepubliceerde tarieven van Anthropic en OpenAI. Statische inhoud zoals systeeminstructies en referentiedocumenten wordt dan één keer verwerkt en tegen een fractie van het tarief herlezen.
Securitybedrijf ProjectDiscovery bracht zijn cache-hitratio van 7% naar 84% door prompts te herstructureren, en verlaagde daarmee zijn totale LLM-uitgaven met 59 tot 70% terwijl het 9,8 miljard tokens uit de cache serveerde. Die ene engineering-oefening won meer budget terug dan de meeste ontslagrondes op naam van AI besparen.
De volgende hefboom is werk naar het juiste model routeren. De eigen prijslijsten van aanbieders laten zien dat topmodellen vijf keer zoveel per token kosten als hun kleinere broertjes, en toch sturen veel productieomgevingen routinematige classificatie en samenvattingen standaard naar de duurste categorie. Batchverwerking levert nog eens 50% korting op voor alles wat geen antwoord in realtime nodig heeft.
Retrieval-augmented generation pakt het probleem van een andere kant aan door het model alleen het relevante deel van een kennisbank te sturen in plaats van het geheel, en prompt compression schrapt de overbodige voorbeelden die elke aanroep opblazen. Open-weight modellen drukken de kosten verder, en verwerken routinetaken tegen een fractie van de prijs van frontier-API's voor teams die de infrastructuur zelf willen beheren.
Deze maatregelen zijn simpelweg het AI-equivalent van de lampen uitdoen in lege kamers. Ubers limiet van 1.500 dollar per engineer per maand, ingevoerd na de overschrijding in april, is een vroeg teken dat de discipline uiteindelijk komt. De bedrijven die voorop lopen kiezen er alleen voor voordat het budget hen ertoe dwingt.
De andere helft van de oplossing is menselijk
Het optimaliseren van de tokenrekening telt alleen als de besparing ergens productiefs naartoe gaat, en het sterkste bewijs wijst naar mensen. Poitevins onderzoek liet zien dat de organisaties die hun rendement verbeterden juist AI gebruikten om hun personeel te versterken in plaats van te vervangen.
Klarna deed het gecontroleerde experiment namens iedereen, en verving ongeveer 700 klantenservicefuncties door een assistent op basis van OpenAI, totdat de klanttevredenheid daalde. Topman Sebastian Siemiatkowski vertelde Bloomberg wat weinig bestuurders hardop toegeven: "Het resultaat was lagere kwaliteit, en dat is niet houdbaar."
De fintech draait nu een gemengd model, waarbij AI het routinematige volume opvangt en heraangenomen mensen alles doen wat oordeelsvermogen vraagt. Gartner verwacht dat dit patroon zich verspreidt, en voorspelt dat tegen 2027 de helft van de bedrijven die klantenservicepersoneel voor AI schrapten, die mensen weer aanneemt.
Er is één personeelsinvestering die de optimalisatielogica dringend maakt in plaats van optioneel. Het Institute for Human-Centered AI van Stanford University vond dat de werkgelegenheid voor softwareontwikkelaars van 22 tot 25 jaar met bijna 20% daalde ten opzichte van 2024, terwijl de oudere leeftijdsgroepen juist groeiden. Dat betekent dat bedrijven de kweekvijver weghalen voor de senior engineers die ze over vijf jaar nodig hebben om al die systemen aan te sturen.
Een bedrijf dat net 60% van zijn tokenrekening heeft geschrapt, heeft de budgetruimte om te blijven aannemen aan de onderkant. Of het dat ook doet, is een leiderschapsbeslissing, geen financiële.
De provocatie van Nvidia's Huang zal blijven doorklinken in kwartaalcijfers, en de capex-getallen zullen blijven stijgen. De bedrijven die er als winnaar uitkomen zijn niet degene die het meest aan tokens uitgaven of de meeste mensen ontsloegen om dat te betalen. Het zijn de bedrijven die zagen dat het tokenbudget al die tijd de flexibele post was, het met engineering in plaats van ontslagen indrukten, en het verschil besteedden aan de mensen die de tokens hun waarde geven.
Klaar om je organisatie te transformeren met AI?
Ontdek hoe wij je kunnen helpen met AI workflow automatisering.
Neem Contact Op