Het gesprek wordt langer
Bij elke beurt gaat de hele voorgeschiedenis mee. Een gesprek van twintig beurten kost aan het eind veel meer per vraag dan aan het begin, terwijl de gebruiker niets anders doet.
Hosting van een gewone webapp is redelijk voorspelbaar. Een AI-functie niet: die kost per aanroep, en hoeveel dat is hangt af van hoeveel tekst er heen en weer gaat. Bij tien testgebruikers valt dat niet op. Bij duizend wel, en dan blijkt de rekening soms harder te groeien dan het gebruik. Hieronder hoe de rekenmachine werkt en waar je aan kunt draaien.
Een taalmodel rekent per token: ongeveer een woorddeel, in en uit.
Modellen verwerken tekst in tokens. Een token is grofweg een stuk van een woord; een Nederlandse zin van twintig woorden is al snel dertig tokens. Je betaalt voor wat je instuurt en voor wat het model teruggeeft, met een ander tarief voor elk.
Het instuurdeel wordt vaak onderschat. Een chat die het hele gesprek onthoudt, stuurt dat gesprek bij elke nieuwe vraag opnieuw mee. Een assistent die eerst tien documenten opzoekt en meestuurt, betaalt voor die tien documenten bij iedere vraag. De vraag van de gebruiker is meestal het goedkoopste deel van de aanroep.
Bij AI-app-builders zie je hetzelfde in een andere verpakking: credits. Eén opdracht die het model veel laat lezen en schrijven, kost meer credits dan een kleine correctie. Dat verklaart waarom je maandbudget soms halverwege op is terwijl je gevoel zegt dat je weinig gedaan hebt.
Drie patronen die we in de praktijk het vaakst zien.
Bij elke beurt gaat de hele voorgeschiedenis mee. Een gesprek van twintig beurten kost aan het eind veel meer per vraag dan aan het begin, terwijl de gebruiker niets anders doet.
Om het antwoord beter te maken, stuur je documenten of gegevens mee. Dat werkt, maar je betaalt voor elk stuk tekst bij elke vraag, ook als het antwoord uiteindelijk uit één alinea komt.
Een agent die zichzelf corrigeert of meerdere stappen zet, doet per opdracht een reeks aanroepen. Werkt hij door tot hij tevreden is, dan bepaalt niet jij maar het model hoe vaak dat gebeurt.
Vijf ingrepen die het verbruik meestal fors verlagen zonder dat gebruikers er iets van merken.
Een dag geeft je een gemeten richting, geen jaarbegroting.
De goedkoopste manier om niet verrast te worden is één middag rekenen aan de echte cijfers.
Wat wij in een bouwdag doen als kosten een rol spelen: de interactie die je het vaakst verwacht, één keer echt uitvoeren en het verbruik uitlezen. Daarna hetzelfde met een kleiner model en met een ingekorte context. Je hebt dan drie gemeten punten in plaats van een gevoel.
Vervolgens vermenigvuldig je met het gebruik dat je verwacht, en nog eens met tien. Als de uitkomst bij tien keer je verwachting nog te dragen is, heb je ruimte om te groeien. Is dat niet zo, dan weet je dat vóór je de app weggeeft in plaats van erna.
Bouw daarnaast vanaf dag één een teller in die per gebruiker bijhoudt wat er verbruikt wordt. Dat is een half uur werk en het is het enige waarmee je later kunt zien wíe de rekening veroorzaakt.
Een stukje tekst dat het model als eenheid verwerkt, ongeveer ter grootte van een woorddeel. Nederlandse tekst valt vaak in meer tokens uiteen dan Engelse, omdat modellen doorgaans op veel Engels zijn getraind. Voor een ruwe schatting kun je aanhouden dat honderd woorden Nederlands rond de honderdvijftig tokens zit.
Waarschijnlijk stuurt hij het hele gesprek elke beurt opnieuw mee. Bij de eerste vraag is dat niets, bij de twintigste is het een lap tekst. Een samenvatting van de oudere beurten plus de laatste paar vragen houdt de kosten vlak, meestal zonder dat de gebruiker merkt dat er iets is ingekort.
Het idee is hetzelfde: je betaalt naar gebruik. Een builder verpakt het alleen in eigen eenheden en telt vaak ook het lezen van je bestaande code mee. Daarom kost een kleine wijziging in een groot project meer dan dezelfde wijziging in een klein project.
Bij de meeste aanbieders kun je een maandplafond en waarschuwingen instellen, en dat is verstandig. Bouw daarnaast in je eigen app een limiet per gebruiker: aantal aanroepen per dag of een maximum aan verbruik. Dat vangt zowel misbruik als de gebruiker die per ongeluk een script erop loslaat.
Dat hangt volledig van de taak af. Voor classificeren, samenvatten en het herschrijven van korte teksten is het verschil vaak niet te zien. Voor redeneren over meerdere stappen of het schrijven van code meestal wel. De enige manier om het te weten is beide op jouw eigen voorbeelden uitproberen.
Het is er een apart onderdeel van. Hosting, onderhoud en domein zijn redelijk vast; AI-verbruik beweegt met je gebruikers mee. Reken die twee daarom apart door, anders lijkt je maandlast voorspelbaar terwijl het duurste deel juist meebeweegt.
In een bouwdag meten we het verbruik van de interactie die je het vaakst verwacht, met twee modellen naast elkaar. Dan heb je cijfers in plaats van een inschatting.
Een korte intake volgt na je inschrijving. Daarna stemmen we scope en datum af.
We nemen contact op om de intake in te plannen.
We gebruiken cookies om je ervaring te verbeteren en het gebruik van de site te meten.