Welke AI-verbruiksstatistieken moet je gebruiken voor chargeback en showback?

Welke AI-verbruiksmetrics het meest geschikt zijn voor chargeback en showback, hangt af van het type AI-workload. Voor grote taalmodellen (LLM’s) is het aantal tokens de meest nauwkeurige en algemeen aanvaarde verbruikseenheid. Voor andere AI-workloads, zoals inferentietaken, trainingsruns of computervisietaken, zijn GPU-uren, het aantal API-aanroepen en rekentijd praktischer toewijzingseenheden. Het kiezen van de verkeerde maatstaf leidt tot een oneerlijke kostenverdeling en ondermijnt de verantwoordingsplicht die uw organisatie probeert op te bouwen. Dit artikel bespreekt de meest voorkomende maatstaven, hoe u hieruit een keuze kunt maken en wanneer u moet overstappen van showback naar volledige chargeback.

Wat is het verschil tussen ‘chargeback’ en ‘showback’ bij AI-kosten?

Bij ‘showback’ worden de AI-uitgaven teruggemeld aan de teams die ze hebben gegenereerd, zonder dat de financiële verantwoordelijkheid wordt overgedragen. ‘Chargeback’ gaat een stap verder: hierbij worden de werkelijke kosten toegerekend aan bedrijfsonderdelen, producten of kostenplaatsen, waardoor die teams financieel verantwoordelijk worden voor hun AI-gebruik. Dit onderscheid is belangrijk, omdat ‘showback’ het bewustzijn vergroot, terwijl ‘chargeback’ gedragsverandering stimuleert.

In de praktijk beginnen de meeste organisaties met showback, omdat daarvoor minder afstemming binnen de organisatie nodig is. Je maakt de gegevens zichtbaar, teams zien wat ze uitgeven en er ontstaan gesprekken over optimalisatie. Het risico is dat inzicht zonder verantwoordelijkheid zelden leidt tot blijvende kostendiscipline. Teams die geen eigen begrotingspost hebben, hebben weinig structurele prikkels om hun verbruik te verminderen.

Chargeback dicht die kloof door de uitgaven voor AI te koppelen aan de teams die daarover de controle hebben. Wanneer een engineeringteam weet dat het maandelijkse LLM-verbruik op de begroting van zijn kostenplaats komt te staan, worden efficiëntie bij het opstellen van prompts en modelkeuze praktische overwegingen in plaats van abstracte. Dit vormt de basis voor een gedegen FinOps voor AI: consumptie koppelen aan verantwoordelijkheid, zodat elke dollar die aan AI wordt uitgegeven, in handen is van iemand die de bevoegdheid en de motivatie heeft om deze te optimaliseren.

Welke AI-verbruiksstatistieken worden het meest gebruikt voor kostenverdeling?

De meest gebruikte AI-verbruiksmetrics voor kostenverdeling zijn het aantal tokens (voor LLM’s), GPU-uren, het aantal API-aanroepen, rekentijd en modelinferentie-eenheden. Elke metric komt overeen met een ander type workload, en de meeste organisaties gebruiken een combinatie daarvan, afhankelijk van welke AI-diensten hun teams gebruiken.

Hieronder wordt weergegeven hoe deze statistieken over de verschillende soorten workloads zijn verdeeld:

  • Aantal tokens: Per verzoek verbruikte invoer- en uitvoertokens, gebruikt voor LLM-API’s zoals OpenAI, Azure OpenAI en Anthropic
  • GPU-uren: De tijd dat een GPU-instantie bezet is, gebruikt voor trainingsopdrachten en zelfgehoste modelinferentie
  • Aantal API-aanroepen: Aantal verzoeken dat naar een model-eindpunt is verzonden; nuttig als vervangende maatstaf wanneer er geen tokengegevens beschikbaar zijn
  • Reken tijd: Verbruikte kloktijd of CPU-tijd, relevant voor batch-inferentiepijplijnen en ML-trainingsworkflows
  • Modelinferentie-eenheden: Een leveranciersspecifieke verbruikseenheid die door sommige cloudproviders wordt gebruikt om de onderliggende rekencapaciteit te abstraheren
  • Opslag- en opvraagkosten: Hoewel dit vaak over het hoofd wordt gezien, leveren query’s op vectordatabases en de opslag van embeddings een aanzienlijke bijdrage aan de totale AI-uitgaven

Om de juiste maatstaf te kiezen, moet u eerst weten op basis van welke van deze maatstaven uw cloudprovider of AI-leverancier u daadwerkelijk factureert. Uw toewijzingsmodel moet zo nauw mogelijk aansluiten bij de factureringseenheid, om afrondingsfouten te voorkomen die zich over verschillende teams en rapportageperiodes heen opstapelen.

Hoe kies je de juiste AI-maatstaf voor je allocatiemodel?

Kies de AI-verbruiksmaatstaf die het meest rechtstreeks weergeeft hoe kosten ontstaan en hoe teams hun verbruik beheersen. De beste maatstaf is degene die al in je factuurgegevens wordt gebruikt, waarop individuele teams invloed kunnen uitoefenen via hun eigen beslissingen, en die stabiel genoeg is om in de loop van de tijd te volgen zonder dat er voortdurend bijgestuurd hoeft te worden.

Bij je keuze kun je je laten leiden door drie praktische criteria:

  1. Nauwkeurigheid van de facturering: Komt deze maatstaf overeen met wat uw leverancier u in rekening brengt? Als uw LLM-aanbieder per token factureert, leidt toewijzing op basis van het aantal API-aanroepen tot vertekening, omdat het aantal aanroepen geen rekening houdt met variaties in de lengte van de prompts.
  2. Beheersbaarheid van het team: Kan het gebruikende team deze statistiek daadwerkelijk verlagen door middel van zijn eigen beslissingen? Het aantal tokens kan worden beheerst door middel van een goed ontworpen prompt en het beheer van het contextvenster. Het aantal GPU-uren kan worden beheerst door middel van taakplanning en de keuze van de juiste instance. Metrics-teams kunnen geen frustratie veroorzaken zonder tegelijkertijd optimalisatie te stimuleren.
  3. Beschikbaarheid van gegevens: Wordt deze maatstaf op betrouwbare wijze vastgelegd in uw kosten- en gebruiksgegevens? Een theoretisch ideale maatstaf heeft geen nut als deze handmatig moet worden verzameld of slechts gedeeltelijk beschikbaar is in uw systemen.

Als één enkele maatstaf geen volledig beeld geeft, kies dan voor een samengestelde aanpak. Wijs bijvoorbeeld de kosten voor de LLM-API toe op basis van het aantal tokens en de kosten voor de infrastructuur van zelfgehoste modellen op basis van GPU-uren. Leg de methodologie duidelijk vast, zodat de financiële, IT- en engineeringteams allemaal begrijpen hoe hun kosten worden berekend.

Waarom wordt bij de toewijzing van kosten voor grote taalmodellen de voorkeur gegeven aan op tokens gebaseerde maatstaven?

Voor de toewijzing van LLM-kosten wordt de voorkeur gegeven aan op tokens gebaseerde maatstaven, omdat deze een directe weerspiegeling vormen van de manier waarop LLM-aanbieders hun tarieven berekenen. Tokens vormen de basisunit van het LLM-verbruik: elke verzonden prompt en elk gegenereerd antwoord wordt gemeten in tokens, en de factuur die u ontvangt, komt rechtstreeks overeen met het aantal tokens. Toewijzing op basis van tokens leidt daarom tot kostentoewijzingen die nauwkeurig overeenkomen met de werkelijke uitgaven.

Naast de nauwkeurigheid van de facturering leggen tokens ook belangrijke verschillen in verbruiksgedrag vast die andere maatstaven over het hoofd zien. Een team dat lange prompts met gedetailleerde systeeminstructies gebruikt, verbruikt veel meer tokens per verzoek dan een team dat korte, strak afgebakende zoekopdrachten uitvoert. Het aantal API-aanroepen behandelt deze beide situaties op dezelfde manier. Het aantal tokens weerspiegelt het werkelijke kostenverschil en zorgt voor de juiste prikkel: teams die investeren in prompt engineering om het tokengebruik te verminderen, zien een directe daling in hun toegewezen kosten.

Bij toewijzing op basis van tokens worden ook de kosten voor invoer en uitvoer gescheiden. Dit is van belang omdat de meeste LLM-aanbieders verschillende tarieven hanteren voor invoertokens en uitvoertokens. Een kostenmodel dat onderscheid maakt tussen beide geeft teams een nauwkeuriger beeld van waar hun uitgaven zich concentreren en welke optimalisatiemaatregel (kortere prompts of beknoptere uitvoer) het grootste effect zal hebben.

De praktische beperking is dat tokengegevens moeten worden vastgelegd op de applicatielaag of via de kosten- en gebruiksrapporten van uw cloudprovider. Als uw teams LLM-API’s aanroepen via abstractielagen of middleware die het aantal tokens niet registreert, moet u die laag eerst uitrusten met meetinstrumenten voordat toewijzing op basis van tokens haalbaar wordt.

Welke tools en gegevensbronnen ondersteunen het meten van AI-verbruik?

Het meten van het AI-verbruik wordt ondersteund door kosten- en gebruiksrapporten van cloudproviders, dashboards voor het gebruik van LLM-API’s, FinOps-platforms en op maat gemaakte observability-tools. De juiste combinatie hangt af van de vraag of uw AI-workloads worden uitgevoerd op beheerde API’s, zelfgehoste infrastructuur of een combinatie van beide.

Voor beheerde LLM-API’s zijn de belangrijkste gegevensbronnen:

  • Kosten- en gebruiksrapporten van cloudproviders: De exportbestanden van Azure Cost Management, AWS Cost Explorer en Google Cloud Billing bevatten allemaal posten voor AI-services met gedetailleerde verbruiksgegevens
  • Dashboards voor leveranciersgebruik: OpenAI, Anthropic en soortgelijke aanbieders bieden gebruiks-API’s en dashboards aan die het verbruik op tokenniveau per API-sleutel of project weergeven
  • FinOps-platforms: Tools zoals Apptio Cloudability brengen de AI-uitgaven voor meerdere cloudomgevingen en verschillende leveranciers samen in één overzicht, met mogelijkheden voor tagging en toewijzing

Voor zelfgehoste AI-workloads of AI-workloads op infrastructuurniveau:

  • Tools voor kostenverdeling in Kubernetes: Platforms zoals Kubecost of ingebouwde functies voor de toewijzing van cloudkosten wijzen GPU- en rekenkosten toe aan namespaces, teams of workloads
  • Observabiliteit van ML-platforms: Tools zoals MLflow, Weights and Biases of SageMaker Experiments houden het rekenverbruik op taakniveau bij en kunnen kostengegevens doorgeven aan toewijzingsmodellen
  • Aangepaste tagging en etikettering: Een consistente tagging van middelen per team, product en omgeving vormt de basis waardoor elke meettool bruikbaar is voor toewijzing

Onze Implementatie van FinOps-tools Het werk begint hier meestal als volgt: nagaan welke gegevens daadwerkelijk worden vastgelegd, hiaten in de tagging-dekking opsporen en AI-kostengegevens integreren in de bredere IT-financiële beheersstructuur, zodat de AI-uitgaven zichtbaar zijn naast de kosten voor on-premises- en cloudinfrastructuur.

Wanneer moet een organisatie voor AI overschakelen van ‘showback’ naar ‘chargeback’?

Een organisatie zou voor AI moeten overschakelen van ‘showback’ naar ‘chargeback’ wanneer aan drie voorwaarden is voldaan: de AI-uitgaven zijn aanzienlijk genoeg om een eigen begroting te rechtvaardigen, de gegevens over de kostentoewijzing zijn betrouwbaar genoeg om individuele kostenposten te onderbouwen, en de bedrijfsonderdelen die gebruikmaken van AI hebben voldoende controle over hun verbruik om verantwoording af te leggen.

Timing is belangrijk, omdat een te vroege chargeback voor wrijving zorgt zonder dat dit tot resultaten leidt. Als je tagging onvolledig is, je tokengegevens inconsistent zijn of als teams geen praktische manier hebben om hun verbruik te beïnvloeden, zal chargeback eerder tot geschillen leiden dan tot optimalisatie. Showback is het geschikte model terwijl je werkt aan de gegevenskwaliteit en de organisatorische paraatheid die chargeback vereist.

Concrete aanwijzingen dat u klaar bent om over te stappen op chargeback zijn onder meer:

  • AI-kosten worden consistent en nauwkeurig weergegeven in uw kosten- en gebruiksrapporten, met toewijzing op teamniveau
  • De bedrijfsonderdelen hebben zich al verdiept in de showback-gegevens en zijn vragen gaan stellen over hun verbruik
  • Product- en engineeringteams beschikken over begrotingsbevoegdheid en kunnen beslissingen nemen over modelkeuze, het ontwerp op korte termijn of gebruiksbeperkingen
  • De financiële afdeling heeft een toewijzingsmethode goedgekeurd en de teams weten hoe de kosten worden berekend
  • Er is een vast ritme voor het toezicht op AI-uitgaven en het oplossen van geschillen over de toewijzing daarvan

A Beoordeling van de FinOps-rijpheid is een nuttig uitgangspunt als u niet zeker weet waar uw organisatie zich op dit gereedheidsspectrum bevindt. Het biedt u een objectief uitgangspunt op het gebied van mensen, processen, governance en tools, voordat u kiest voor een chargeback-model dat uw huidige capaciteiten wellicht nog niet ondersteunen.

Hoe wij helpen bij het meten van AI-verbruik en het toewijzen van kosten

Wij helpen organisaties om de overstap te maken van een basaal inzicht in AI-kosten naar gestructureerde, onderbouwde toewijzingsmodellen die AI-uitgaven koppelen aan zakelijke verantwoording. Onze aanpak omvat alle aspecten die ervoor zorgen dat chargeback en showback in de praktijk goed functioneren:

  • Keuze van de meetmethoden en opzet van de methodologie: We brengen de verbruiksstatistieken in kaart die aansluiten bij uw factuurgegevens en uw mix van werklasten, en stellen een toewijzingsmethode op waar zowel de financiële afdeling, IT als de technische afdeling achter kunnen staan
  • Tagging en gegevenskwaliteit: We voeren een audit uit van uw huidige taggingdekking binnen cloud- en AI-diensten, vullen de hiaten aan en zorgen ervoor dat uw kosten- en gebruiksgegevens betrouwbaar genoeg zijn om de toewijzing op teamniveau te ondersteunen
  • FinOps-bedrijfsmodel: Wij helpen u bij het opzetten van de bestuursstructuur, het besluitvormingsritme en de functieoverschrijdende verantwoordingsplicht die ervoor zorgen dat kostengegevens daadwerkelijk tot actie leiden, in plaats van alleen maar tot rapportage.
  • Integratie van TBM en FinOps: We koppelen de kostentoewijzing voor AI aan uw bredere financiële IT-beheersstructuur, zodat de AI-uitgaven samen met de on-premises- en cloudinfrastructuur worden geëvalueerd in één samenhangend overzicht
  • Overgang van showback naar chargeback: Wij begeleiden de organisatorische en technische stappen die nodig zijn om de overstap te maken van bewustwording naar verantwoordelijkheid, in een tempo dat uw teams aankunnen

Als u wilt weten hoe uw organisatie er op dit moment voor staat en wat er nodig is om een betrouwbaar AI-model voor kostenverdeling op te zetten, neem contact met ons op en we beginnen met een praktische beoordeling van uw huidige vaardigheden.

De waarde
Privacyoverzicht

Deze site maakt gebruik van cookies, zodat wij je de best mogelijke gebruikerservaring kunnen bieden. Cookie-informatie wordt opgeslagen in je browser en voert functies uit zoals het herkennen wanneer je terugkeert naar onze site en helpt ons team om te begrijpen welke delen van de site je het meest interessant en nuttig vindt.