Lezen en zoeken
Uitzoeken welke bestanden ertoe doen, is opzoekwerk. Daar heb je geen redeneervermogen voor nodig, alleen leessnelheid.
Twee dingen veranderden deze zomer tegelijk. De prijs per eenheid rekenwerk daalde fors, en agents kregen de mogelijkheid om per deeltaak een ander model te gebruiken. Samen maken die twee een keuze mogelijk die er eerder niet was: het zware model voor het denkwerk, een goedkoop model voor de rest.
Niet één model dat alles doet, maar een ploeg met verschillende tarieven.
Tot voor kort koos je één model en dat deed alles: de moeilijke afweging én het opzoeken van een bestandsnaam. Je betaalde dus voor het duurste denkwerk, ook bij het domste klusje.
Agents die met deelopdrachten werken, kunnen nu per deelopdracht een model kiezen. De hoofdagent redeneert met het sterkste model, en de sub-agenten die tests draaien, documentatie bijwerken of bestanden doorzoeken, doen dat met iets goedkopers.
Daar bovenop kwamen de prijsdalingen. Het vlaggenschipmodel van Anthropic kwam eind juli uit op ongeveer de helft van de prijs van zijn voorganger, en OpenAI verlaagde de tarieven op sommige modellen met tot tachtig procent. Open modellen die je zelf draait, zijn inmiddels goedkoop genoeg om er agentwerk mee te doen voor centen.
Uitzoeken welke bestanden ertoe doen, is opzoekwerk. Daar heb je geen redeneervermogen voor nodig, alleen leessnelheid.
Dezelfde wijziging in twintig bestanden. Als de eerste goed is, is de rest patroonwerk.
Een lange uitvoer terugbrengen tot wat ertoe doet. Klassiek werk voor een klein model.
Drie signalen die eerder komen dan een echte fout.
Het eerste is dat je vaker moet herhalen wat je bedoelde. Een goedkoper model dat de opdracht net anders leest, kost je twee extra beurten — en die twee beurten zijn samen duurder dan het verschil dat je dacht te besparen.
Het tweede is dat het resultaat klopt maar niet past. De code doet wat er gevraagd is en volgt niet de manier waarop de rest van je project is opgebouwd. Dat merk je niet aan een foutmelding maar aan het gevoel dat je aan het opruimen bent in plaats van aan het bouwen.
Het derde is dat de agent vaker vastloopt op iets kleins. Een pad dat niet klopt, een naam die net anders is. Zwaardere modellen redden zich daar doorheen; lichtere blijven eraan hangen. Als je dat merkt, zet die stap terug in plaats van je opdracht scherper te formuleren.
Niet op onderbuik, maar op wat de taak vraagt.
De bruikbaarste vraag is: heeft deze stap een oordeel nodig of alleen een uitvoering? Alles wat een oordeel vraagt, gaat naar het sterke model. Alles wat een instructie uitvoert die al vaststaat, kan goedkoper.
Een tweede vraag die helpt: hoe erg is het als deze stap fout gaat en ik merk het pas later? Een fout in een samenvatting merk je meteen. Een fout in de opzet van je gegevensmodel merk je over drie maanden. Dat verschil bepaalt waar je op bezuinigt.
Wat je in de praktijk ziet gebeuren, is dat mensen te ver doorslaan naar goedkoop en dan concluderen dat het niet werkt. De verhouding die bij ons standhoudt, is ongeveer een derde van de stappen op het zware model en de rest eronder — maar dat derde deel is wel het deel waar alles op rust.
Op een gemiddelde bouwsessie is het verschil merkbaar maar niet spectaculair: je verbruik zakt, en het valt vooral op bij lange sessies met veel opzoekwerk. Wie een uur per dag met een agent werkt, merkt het in zijn maandrekening; wie een keer per week iets bouwt, nauwelijks.
Waar het wél groot wordt, is bij werk dat in de breedte gaat: een migratie over honderd bestanden, een set tests aanvullen, een codebase doorzoeken op een patroon. Daar zit het meeste verbruik in stappen die geen oordeel vragen, en daar loopt het verschil op tot een veelvoud.
Reken er tegelijk op dat de tarieven blijven bewegen. Wat vandaag een goede verdeling is, kan over een half jaar anders liggen. Bouw je opzet daarom zo dat je de keuze per stap kunt veranderen zonder je hele werkwijze om te gooien.
Dezelfde afweging geldt voor de AI-functies die jij inbouwt.
Als je een assistent in je eigen app zet, betaal je per gebruik aan een modelaanbieder terwijl je klant je waarschijnlijk per maand betaalt. Dat gat is waar marges verdwijnen, en het is precies dezelfde afweging: welk deel van je functie heeft het zware model nodig?
In veel producten is dat maar een klein deel. Het herkennen van wat iemand bedoelt, het samenvatten van een gesprek, het ophalen van het juiste stuk tekst — dat kan meestal een tandje lager. Alleen het antwoord zelf, het stuk dat je klant leest, vraagt het beste dat je hebt.
Wie dat onderscheid maakt bij het ontwerpen, houdt een functie over die betaalbaar blijft als het gebruik verdubbelt. Wie het niet maakt, ontdekt het bij de eerste klant die je functie tien keer intensiever gebruikt dan de rest.
Iets wat je toch moet doen en groot genoeg om ergens vast te lopen. Standaardvoorbeelden zeggen niets over jouw codebase.
Eén keer volledig op het zware model, één keer met de verdeling. Vergelijk niet de snelheid maar hoeveel je zelf moest corrigeren.
Bij de meeste aanbieders zie je het per dag. Begin per klus een nieuw gesprek, dan is de toewijzing grof maar bruikbaar.
In een bouwdag telt voorspelbaarheid zwaarder dan de laatste procenten besparing. We laten het denkwerk op het beste model lopen en zetten alleen het duidelijke opzoek- en herhaalwerk lager. Dat is geen optimalisatie maar een vangnet: als er iets misgaat, wil je niet ook nog uitzoeken of het aan de modelkeuze lag.
Wat we wel altijd doen, is een plafond instellen voordat we beginnen. Niet omdat we verwachten eroverheen te gaan, maar omdat een agent die in een lus belandt anders de hele dag doorrekent zonder dat iemand het ziet.
Bij het werk waarvoor je het goedkopere model inzet, hoort dat niet zo te zijn. Merk je het wel, dan heb je een stap lager gezet die eigenlijk een oordeel vraagt — dat is de aanwijzing om hem terug te zetten.
Bij de meeste agents is het een instelling per soort deelopdracht. Je hoeft er niets voor te bouwen; je moet vooral bedenken welke stappen bij welke categorie horen.
Per eenheid rekenwerk vaak wel, maar dan komen er kosten bij die je eerst niet had: een machine die draait, iemand die hem onderhoudt, en het moment waarop hij stukgaat. Voor incidenteel gebruik zelden de moeite.
De richting is al een paar jaar dezelfde, maar de modellen zetten tegelijk meer stappen per opdracht. Die twee heffen elkaar deels op, dus reken niet met de prijs van vandaag voor volgend jaar.
Dan is het geen reden om over te stappen. Het verschil is er, maar het weegt niet op tegen het opnieuw inrichten van je hele werkwijze.
Zet een limiet in vóór je begint en kijk na de eerste week naar je verbruik. Bijna iedereen verbruikt in het begin meer dan verwacht, en dat ligt zelden aan de tarieven.
In een bouwdag ontsluiten we één systeem met leesrechten en bouwen we een assistent die er vragen over beantwoordt. Dan weet je of het idee hout snijdt.
Een korte intake volgt na je inschrijving. Daarna stemmen we scope en datum af.
We nemen contact op om de intake in te plannen.
We gebruiken cookies om je ervaring te verbeteren en het gebruik van de site te meten.