Wat kosten de AI-functies in je app?

Hosting van een gewone webapp is redelijk voorspelbaar. Een AI-functie niet: die kost per aanroep, en hoeveel dat is hangt af van hoeveel tekst er heen en weer gaat. Bij tien testgebruikers valt dat niet op. Bij duizend wel, en dan blijkt de rekening soms harder te groeien dan het gebruik. Hieronder hoe de rekenmachine werkt en waar je aan kunt draaien.

Terug naar OneDayBuild
01/06

Hoe de rekening tot stand komt

Een taalmodel rekent per token: ongeveer een woorddeel, in en uit.

Modellen verwerken tekst in tokens. Een token is grofweg een stuk van een woord; een Nederlandse zin van twintig woorden is al snel dertig tokens. Je betaalt voor wat je instuurt en voor wat het model teruggeeft, met een ander tarief voor elk.

Het instuurdeel wordt vaak onderschat. Een chat die het hele gesprek onthoudt, stuurt dat gesprek bij elke nieuwe vraag opnieuw mee. Een assistent die eerst tien documenten opzoekt en meestuurt, betaalt voor die tien documenten bij iedere vraag. De vraag van de gebruiker is meestal het goedkoopste deel van de aanroep.

Bij AI-app-builders zie je hetzelfde in een andere verpakking: credits. Eén opdracht die het model veel laat lezen en schrijven, kost meer credits dan een kleine correctie. Dat verklaart waarom je maandbudget soms halverwege op is terwijl je gevoel zegt dat je weinig gedaan hebt.

02/06

Waar de kosten vandaan komen

Drie patronen die we in de praktijk het vaakst zien.

Het gesprek wordt langer

Bij elke beurt gaat de hele voorgeschiedenis mee. Een gesprek van twintig beurten kost aan het eind veel meer per vraag dan aan het begin, terwijl de gebruiker niets anders doet.

Context wordt ruim meegestuurd

Om het antwoord beter te maken, stuur je documenten of gegevens mee. Dat werkt, maar je betaalt voor elk stuk tekst bij elke vraag, ook als het antwoord uiteindelijk uit één alinea komt.

Er draait iets in een lus

Een agent die zichzelf corrigeert of meerdere stappen zet, doet per opdracht een reeks aanroepen. Werkt hij door tot hij tevreden is, dan bepaalt niet jij maar het model hoe vaak dat gebeurt.

03/06

Knoppen waar je aan kunt draaien

Vijf ingrepen die het verbruik meestal fors verlagen zonder dat gebruikers er iets van merken.

  • Kies per taak een model. Niet elke vraag heeft het zwaarste model nodig. Classificeren, samenvatten en routeren kan vaak met een kleiner en goedkoper model; het zware model bewaar je voor waar het verschil zichtbaar is.
  • Kort de geschiedenis in. Stuur niet het hele gesprek mee maar een samenvatting plus de laatste beurten. Dat houdt de kosten vlak in plaats van oplopend.
  • Zoek eerst, stuur dan minder. In plaats van tien documenten meesturen, zoek je de drie relevantste stukken op en stuur je alleen die mee. Dat verlaagt het verbruik en verbetert meestal het antwoord.
  • Cache wat zich herhaalt. Vaste instructies en veelgestelde vragen hoeven niet elke keer opnieuw verwerkt te worden. Veel aanbieders rekenen minder voor herhaald contextgebruik.
  • Zet harde grenzen. Een maximum per gebruiker per dag en een alarm op je totale verbruik. Zonder plafond kan één script of één enthousiaste gebruiker een maandbudget in een uur opmaken.
04/06

Wat je in een bouwdag wél en niet kunt weten

Een dag geeft je een gemeten richting, geen jaarbegroting.

Wel te meten op de dag
  • Hoeveel tokens één typische interactie kost, gemeten in plaats van geschat.
  • Of een kleiner model hetzelfde resultaat geeft voor dit specifieke doel.
  • Hoeveel het scheelt als je context inkort of gerichter opzoekt.
  • Welke limieten je zonder klachten kunt instellen.
Pas zichtbaar bij echt gebruik
  • Hoe lang gesprekken worden als echte gebruikers erin zitten.
  • Welk deel van je gebruikers de zware functie dagelijks gebruikt.
  • Of er misbruik ontstaat zodra de app openbaar is.
  • Wat aanbieders volgend jaar rekenen; die tarieven bewegen.
05/06

Meten voordat je het weggeeft

De goedkoopste manier om niet verrast te worden is één middag rekenen aan de echte cijfers.

Wat wij in een bouwdag doen als kosten een rol spelen: de interactie die je het vaakst verwacht, één keer echt uitvoeren en het verbruik uitlezen. Daarna hetzelfde met een kleiner model en met een ingekorte context. Je hebt dan drie gemeten punten in plaats van een gevoel.

Vervolgens vermenigvuldig je met het gebruik dat je verwacht, en nog eens met tien. Als de uitkomst bij tien keer je verwachting nog te dragen is, heb je ruimte om te groeien. Is dat niet zo, dan weet je dat vóór je de app weggeeft in plaats van erna.

Bouw daarnaast vanaf dag één een teller in die per gebruiker bijhoudt wat er verbruikt wordt. Dat is een half uur werk en het is het enige waarmee je later kunt zien wíe de rekening veroorzaakt.

06/06

Veelgestelde vragen

Wat is een token precies?

Een stukje tekst dat het model als eenheid verwerkt, ongeveer ter grootte van een woorddeel. Nederlandse tekst valt vaak in meer tokens uiteen dan Engelse, omdat modellen doorgaans op veel Engels zijn getraind. Voor een ruwe schatting kun je aanhouden dat honderd woorden Nederlands rond de honderdvijftig tokens zit.

Waarom kost mijn chatbot steeds meer per vraag?

Waarschijnlijk stuurt hij het hele gesprek elke beurt opnieuw mee. Bij de eerste vraag is dat niets, bij de twintigste is het een lap tekst. Een samenvatting van de oudere beurten plus de laatste paar vragen houdt de kosten vlak, meestal zonder dat de gebruiker merkt dat er iets is ingekort.

Zijn credits bij een AI-app-builder hetzelfde als tokens?

Het idee is hetzelfde: je betaalt naar gebruik. Een builder verpakt het alleen in eigen eenheden en telt vaak ook het lezen van je bestaande code mee. Daarom kost een kleine wijziging in een groot project meer dan dezelfde wijziging in een klein project.

Kan ik een limiet instellen zodat ik nooit verrast word?

Bij de meeste aanbieders kun je een maandplafond en waarschuwingen instellen, en dat is verstandig. Bouw daarnaast in je eigen app een limiet per gebruiker: aantal aanroepen per dag of een maximum aan verbruik. Dat vangt zowel misbruik als de gebruiker die per ongeluk een script erop loslaat.

Is een goedkoper model merkbaar slechter?

Dat hangt volledig van de taak af. Voor classificeren, samenvatten en het herschrijven van korte teksten is het verschil vaak niet te zien. Voor redeneren over meerdere stappen of het schrijven van code meestal wel. De enige manier om het te weten is beide op jouw eigen voorbeelden uitproberen.

Hoort dit bij de terugkerende kosten van een app?

Het is er een apart onderdeel van. Hosting, onderhoud en domein zijn redelijk vast; AI-verbruik beweegt met je gebruikers mee. Reken die twee daarom apart door, anders lijkt je maandlast voorspelbaar terwijl het duurste deel juist meebeweegt.

Wil je weten wat jouw AI-functie per gebruiker kost?

In een bouwdag meten we het verbruik van de interactie die je het vaakst verwacht, met twee modellen naast elkaar. Dan heb je cijfers in plaats van een inschatting.