Een goedkoper model voor het simpele werk

Twee dingen veranderden deze zomer tegelijk. De prijs per eenheid rekenwerk daalde fors, en agents kregen de mogelijkheid om per deeltaak een ander model te gebruiken. Samen maken die twee een keuze mogelijk die er eerder niet was: het zware model voor het denkwerk, een goedkoop model voor de rest.

Terug naar Kennis
01/10

Wat er is veranderd

Niet één model dat alles doet, maar een ploeg met verschillende tarieven.

Tot voor kort koos je één model en dat deed alles: de moeilijke afweging én het opzoeken van een bestandsnaam. Je betaalde dus voor het duurste denkwerk, ook bij het domste klusje.

Agents die met deelopdrachten werken, kunnen nu per deelopdracht een model kiezen. De hoofdagent redeneert met het sterkste model, en de sub-agenten die tests draaien, documentatie bijwerken of bestanden doorzoeken, doen dat met iets goedkopers.

Daar bovenop kwamen de prijsdalingen. Het vlaggenschipmodel van Anthropic kwam eind juli uit op ongeveer de helft van de prijs van zijn voorganger, en OpenAI verlaagde de tarieven op sommige modellen met tot tachtig procent. Open modellen die je zelf draait, zijn inmiddels goedkoop genoeg om er agentwerk mee te doen voor centen.

02/10

Waar de winst werkelijk zit

Lezen en zoeken

Uitzoeken welke bestanden ertoe doen, is opzoekwerk. Daar heb je geen redeneervermogen voor nodig, alleen leessnelheid.

Herhaalwerk

Dezelfde wijziging in twintig bestanden. Als de eerste goed is, is de rest patroonwerk.

Samenvatten

Een lange uitvoer terugbrengen tot wat ertoe doet. Klassiek werk voor een klein model.

03/10

Waar je het níet moet doen

  • Bij de vraag wat er moet gebeuren. Een goedkoop model dat een verkeerd plan maakt, kost je een uur nakijken en dat is duurder dan het verschil.
  • Bij foutzoeken. Een fout die zich niet meteen laat zien, vraagt precies het vermogen waarop je bezuinigt.
  • Bij werk waar de gevolgen groot zijn: migraties, rechten, betalingen. Daar is de prijs van het model nooit de post die telt.
  • Bij een codebase die je zelf niet goed kent. Je merkt dan niet dat het antwoord net naast de bedoeling zit.
04/10

Hoe je merkt dat je te ver bent gegaan

Drie signalen die eerder komen dan een echte fout.

Het eerste is dat je vaker moet herhalen wat je bedoelde. Een goedkoper model dat de opdracht net anders leest, kost je twee extra beurten — en die twee beurten zijn samen duurder dan het verschil dat je dacht te besparen.

Het tweede is dat het resultaat klopt maar niet past. De code doet wat er gevraagd is en volgt niet de manier waarop de rest van je project is opgebouwd. Dat merk je niet aan een foutmelding maar aan het gevoel dat je aan het opruimen bent in plaats van aan het bouwen.

Het derde is dat de agent vaker vastloopt op iets kleins. Een pad dat niet klopt, een naam die net anders is. Zwaardere modellen redden zich daar doorheen; lichtere blijven eraan hangen. Als je dat merkt, zet die stap terug in plaats van je opdracht scherper te formuleren.

05/10

Hoe je de verdeling maakt

Niet op onderbuik, maar op wat de taak vraagt.

De bruikbaarste vraag is: heeft deze stap een oordeel nodig of alleen een uitvoering? Alles wat een oordeel vraagt, gaat naar het sterke model. Alles wat een instructie uitvoert die al vaststaat, kan goedkoper.

Een tweede vraag die helpt: hoe erg is het als deze stap fout gaat en ik merk het pas later? Een fout in een samenvatting merk je meteen. Een fout in de opzet van je gegevensmodel merk je over drie maanden. Dat verschil bepaalt waar je op bezuinigt.

Wat je in de praktijk ziet gebeuren, is dat mensen te ver doorslaan naar goedkoop en dan concluderen dat het niet werkt. De verhouding die bij ons standhoudt, is ongeveer een derde van de stappen op het zware model en de rest eronder — maar dat derde deel is wel het deel waar alles op rust.

06/10

Wat het je in de praktijk scheelt

Op een gemiddelde bouwsessie is het verschil merkbaar maar niet spectaculair: je verbruik zakt, en het valt vooral op bij lange sessies met veel opzoekwerk. Wie een uur per dag met een agent werkt, merkt het in zijn maandrekening; wie een keer per week iets bouwt, nauwelijks.

Waar het wél groot wordt, is bij werk dat in de breedte gaat: een migratie over honderd bestanden, een set tests aanvullen, een codebase doorzoeken op een patroon. Daar zit het meeste verbruik in stappen die geen oordeel vragen, en daar loopt het verschil op tot een veelvoud.

Reken er tegelijk op dat de tarieven blijven bewegen. Wat vandaag een goede verdeling is, kan over een half jaar anders liggen. Bouw je opzet daarom zo dat je de keuze per stap kunt veranderen zonder je hele werkwijze om te gooien.

07/10

Wat dit betekent voor je eigen product

Dezelfde afweging geldt voor de AI-functies die jij inbouwt.

Als je een assistent in je eigen app zet, betaal je per gebruik aan een modelaanbieder terwijl je klant je waarschijnlijk per maand betaalt. Dat gat is waar marges verdwijnen, en het is precies dezelfde afweging: welk deel van je functie heeft het zware model nodig?

In veel producten is dat maar een klein deel. Het herkennen van wat iemand bedoelt, het samenvatten van een gesprek, het ophalen van het juiste stuk tekst — dat kan meestal een tandje lager. Alleen het antwoord zelf, het stuk dat je klant leest, vraagt het beste dat je hebt.

Wie dat onderscheid maakt bij het ontwerpen, houdt een functie over die betaalbaar blijft als het gebruik verdubbelt. Wie het niet maakt, ontdekt het bij de eerste klant die je functie tien keer intensiever gebruikt dan de rest.

08/10

Zelf uitproberen zonder gedoe

Neem één echte taak

Iets wat je toch moet doen en groot genoeg om ergens vast te lopen. Standaardvoorbeelden zeggen niets over jouw codebase.

Draai hem twee keer

Eén keer volledig op het zware model, één keer met de verdeling. Vergelijk niet de snelheid maar hoeveel je zelf moest corrigeren.

Kijk naar je verbruik

Bij de meeste aanbieders zie je het per dag. Begin per klus een nieuw gesprek, dan is de toewijzing grof maar bruikbaar.

09/10

Hoe wij het instellen

In een bouwdag telt voorspelbaarheid zwaarder dan de laatste procenten besparing. We laten het denkwerk op het beste model lopen en zetten alleen het duidelijke opzoek- en herhaalwerk lager. Dat is geen optimalisatie maar een vangnet: als er iets misgaat, wil je niet ook nog uitzoeken of het aan de modelkeuze lag.

Wat we wel altijd doen, is een plafond instellen voordat we beginnen. Niet omdat we verwachten eroverheen te gaan, maar omdat een agent die in een lus belandt anders de hele dag doorrekent zonder dat iemand het ziet.

10/10

Veelgestelde vragen

Merk ik verschil in kwaliteit?

Bij het werk waarvoor je het goedkopere model inzet, hoort dat niet zo te zijn. Merk je het wel, dan heb je een stap lager gezet die eigenlijk een oordeel vraagt — dat is de aanwijzing om hem terug te zetten.

Kan ik dit instellen of moet ik programmeren?

Bij de meeste agents is het een instelling per soort deelopdracht. Je hoeft er niets voor te bouwen; je moet vooral bedenken welke stappen bij welke categorie horen.

Is een open model dat ik zelf draai goedkoper?

Per eenheid rekenwerk vaak wel, maar dan komen er kosten bij die je eerst niet had: een machine die draait, iemand die hem onderhoudt, en het moment waarop hij stukgaat. Voor incidenteel gebruik zelden de moeite.

Blijven de prijzen dalen?

De richting is al een paar jaar dezelfde, maar de modellen zetten tegelijk meer stappen per opdracht. Die twee heffen elkaar deels op, dus reken niet met de prijs van vandaag voor volgend jaar.

Wat als mijn agent dit niet ondersteunt?

Dan is het geen reden om over te stappen. Het verschil is er, maar het weegt niet op tegen het opnieuw inrichten van je hele werkwijze.

Hoe voorkom ik een verrassing op mijn rekening?

Zet een limiet in vóór je begint en kijk na de eerste week naar je verbruik. Bijna iedereen verbruikt in het begin meer dan verwacht, en dat ligt zelden aan de tarieven.

Wil je zien wat een assistent met jouw systemen kan?

In een bouwdag ontsluiten we één systeem met leesrechten en bouwen we een assistent die er vragen over beantwoordt. Dan weet je of het idee hout snijdt.