Wie sollten die Kosten für ein gemeinsames Fundamentmodell aufgeteilt werden?

Die Kosten für ein gemeinsames Fundamentmodell sollten auf Basis des tatsächlichen Verbrauchs verteilt werden, wobei jeder Geschäftsbereich oder jedes Team einen Anteil entsprechend den von ihm genutzten Ressourcen zahlt. Die nutzungsbasierte Zuordnung ist der gängigste und am besten zu rechtfertigende Ansatz, auch wenn Unternehmen häufig feste Gemeinkosten hinzurechnen, um gemeinsam genutzte Infrastruktur abzudecken, die nicht direkt zugeordnet werden kann. Die folgenden Fragen beleuchten die einzelnen Aspekte dieser Herausforderung, von den Mechanismen der Kostenverrechnung bis hin zu Tools und Governance.

Was sind die gängigsten Methoden zur Verteilung der Kosten für gemeinsam genutzte KI-Infrastruktur?

Die gängigsten Methoden zur Verteilung der Kosten für gemeinsam genutzte KI-Infrastruktur sind die nutzungsbasierte Verteilung, die Verteilung nach Festpreisen und gestaffelte Preismodelle. Bei der nutzungsbasierten Verteilung werden die Kosten jedem Nutzer proportional zu seinem tatsächlichen Verbrauch in Rechnung gestellt, beispielsweise anhand der Anzahl der Inferenzaufrufe, der verarbeiteten Token oder der genutzten GPU-Stunden. Bei der Verteilung nach Festpreisen werden die vorab festgelegten Kosten gleichmäßig oder nach vereinbarten Prozentsätzen aufgeteilt. Bei der gestaffelten Preisgestaltung werden je nach Servicelevel oder Prioritätszugang unterschiedliche Tarife zugewiesen.

In der Praxis nutzen die meisten großen Unternehmen eine Mischung aus diesen Ansätzen. Eine Basisebene gemeinsamer Infrastrukturkosten, wie beispielsweise der Rechencluster, auf dem das Grundmodell läuft, wird nach einem festen oder proportionalen Schlüssel aufgeteilt. Variable Kosten, die an die tatsächliche Auslastung gekoppelt sind, wie API-Aufrufe oder Feinabstimmungsaufträge, werden dann anhand der Verbrauchsdaten zugeordnet.

Jede Methode bringt Vor- und Nachteile mit sich:

  • Verbrauchsabhängige Zuteilung ist zwar am genauesten, erfordert jedoch eine zuverlässige Erfassung und Kennzeichnung auf Team- oder Anwendungsebene.
  • Zuteilung mit festem Satz ist einfach zu verwalten, kann jedoch zu Unmut führen, wenn die Nutzungsmuster in den einzelnen Teams ungleich verteilt sind.
  • Gestaffelte Preisgestaltung belohnt Teams, die niedrigere Service-Level-Vereinbarungen akzeptieren, mit geringeren Kosten, was dazu beitragen kann, die Nachfrage nach gemeinsam genutzten Ressourcen zu steuern.
  • Ausgehandelte Zuteilung Die Kosten werden nach vorheriger Vereinbarung zugewiesen; diese Methode wird häufig angewendet, wenn sich der Verbrauch nur schwer direkt messen lässt.

Die richtige Methode hängt von der Fähigkeit Ihres Unternehmens ab, das Modell zu implementieren, sowie vom Reifegrad Ihres FinOps-Verfahren, und inwieweit die Geschäftsbereiche zugestimmt haben, für die KI-Ausgaben zur Rechenschaft gezogen zu werden.

Wie funktioniert die nutzungsabhängige Abrechnung bei einem Grundmodell?

Bei der nutzungsbasierten Abrechnung für ein Grundmodell wird der Verbrauch des Modells durch jedes Team gemessen, diesem Verbrauch ein Stückpreis zugewiesen und der entsprechenden Geschäftseinheit der entsprechende Betrag in Rechnung gestellt. Die gängigsten Verbrauchseinheiten sind Inferenzanfragen, verarbeitete Tokens, GPU-Stunden oder API-Aufrufe. Der Preis pro Einheit ergibt sich aus den Gesamtkosten für den Betrieb der gemeinsam genutzten Infrastruktur, geteilt durch den Gesamtverbrauch aller Nutzer.

Um dies umzusetzen, müssen drei Dinge parallel ablaufen. Erstens benötigen Sie eine zuverlässige Erfassung: Jeder Aufruf des Basismodells muss mit einer Kennung für ein Team, ein Produkt oder eine Kostenstelle versehen werden. Zweitens benötigen Sie einen Stückpreis, der die Gesamtkosten der Infrastruktur widerspiegelt, einschließlich Rechenleistung, Speicher, Netzwerk und Support. Drittens benötigen Sie einen regelmäßigen Abrechnungszyklus, in dem die Teams eine Aufstellung darüber erhalten, was sie verbraucht haben und was sie schulden.

Eine häufige Herausforderung besteht darin, dass die Kosten für Grundmodelle nicht immer linear verlaufen. Der Betrieb eines Modells mit einer Kapazität von 10% kostet fast genauso viel wie der Betrieb mit einer Kapazität von 80%, da die festen Infrastrukturkosten den größten Anteil ausmachen. Das bedeutet, dass die Stückkosten je nach Gesamtauslastung erheblich schwanken können, was die Prognosen für einzelne Teams erschwert. Eine Möglichkeit, damit umzugehen, besteht darin, Kosten für eine reservierte Kapazität festzulegen, die sich alle Teams zu gleichen Teilen teilen, und dann nutzungsabhängige Gebühren nur für den Verbrauch oberhalb dieser Basislinie zu erheben.

Was ist der Unterschied zwischen „Showback“ und „Chargeback“ bei KI-Kosten?

Showback weist die KI-Kosten den einzelnen Teams oder Geschäftsbereichen zu, um Transparenz zu schaffen, ohne dass dabei tatsächlich Gelder zwischen den Budgets transferiert werden. Chargeback geht noch einen Schritt weiter: Es verlagert tatsächliche Budgetmittel vom verbrauchenden Team auf das Team oder den Bereich, der für die gemeinsam genutzte Infrastruktur verantwortlich ist. Showback schafft Bewusstsein; Chargeback sorgt für finanzielle Rechenschaftspflicht.

Beide Ansätze sind sinnvoll, und viele Unternehmen beginnen zunächst mit Showback, bevor sie zu Chargeback übergehen. Showback hilft den Teams zu verstehen, welche Kosten durch die Nutzung von KI entstehen, noch bevor sich diese Kosten auf ihre Budgets auswirken. Dies verringert Widerstände und gibt den Teams Zeit, ihre Nutzungsmuster zu optimieren. Chargeback festigt diese Verhaltensänderung anschließend, indem es die Kosten greifbar macht.

Gerade bei Foundation-Modellen ist diese Unterscheidung von Bedeutung, da die Infrastruktur in der Regel zentral verwaltet wird – häufig durch ein Plattformteam oder die IT-Abteilung –, während die Nutzer Produktteams oder Geschäftsbereiche mit eigenen Budgets sind. Ohne Rückverrechnung trägt das Plattformteam alle Kosten, unabhängig davon, wie intensiv das Modell genutzt wird, was den Anreiz für die nutzenden Teams mindert, das Modell effizient einzusetzen. Mit einer Kostenverrechnung hat jedes Team einen direkten finanziellen Anreiz, unnötige Inferenzaufrufe zu minimieren, das Prompt-Design zu optimieren und redundante Feinabstimmungsvorgänge zu vermeiden.

Die Entscheidung zwischen „Showback“ und „Chargeback“ ist letztlich eine Frage der Unternehmensführung. Unternehmen mit einer starken funktionsübergreifenden Abstimmung und einer ausgereiften Kostenverantwortung tendieren dazu, schneller auf „Chargeback“ umzusteigen. Für Unternehmen, die noch dabei sind, Vertrauen zwischen den Bereichen Finanzen, IT und Entwicklung aufzubauen, erweist sich „Showback“ oft als nützlicher Zwischenschritt.

Welche Geschäftsbereiche sollten die Kosten für ein Basismodell tragen?

Die Geschäftsbereiche, die das Basismodell aktiv nutzen, sollten dessen Kosten proportional zu ihrem Verbrauch tragen. Wird ein Modell ausschließlich von einem Team genutzt, sollte dieses Team die gesamten Kosten tragen. Nutzen mehrere Teams das Modell gemeinsam, sollten die Kosten entsprechend der Nutzung aufgeteilt werden, wobei eine gemeinsame Gemeinkostenpauschale für die Basisinfrastruktur anfällt, von der alle Nutzer profitieren, unabhängig davon, wie viel sie verbrauchen.

Dieses Prinzip klingt zwar einfach, wird jedoch kompliziert, wenn ein Grundmodell als strategische Plattform positioniert wird. In solchen Fällen kann die Unternehmensleitung beschließen, dass die Infrastrukturkosten als unternehmensweite Gemeinkosten behandelt werden sollten, anstatt sie den einzelnen Teams in Rechnung zu stellen, da das Modell einen unternehmensweiten Mehrwert liefert, der sich nur schwer einer einzelnen Einheit zuordnen lässt.

Ein praktischer Rahmen für die Entscheidung, wer die Kosten trägt:

  1. Primärverbraucher ermitteln indem ermittelt wird, welche Teams, Produkte oder Anwendungen den meisten Inferenzverkehr erzeugen.
  2. Direkte und indirekte Nutzung voneinander trennen um Teams, die das Modell im Produktivbetrieb einsetzen, von denen zu unterscheiden, die in Entwicklungsumgebungen damit experimentieren.
  3. Variable Kosten den direkten Verbrauchern zuordnen basierend auf dem gemessenen Verbrauch.
  4. Verteilung der festen Infrastrukturkosten über alle Teams mit Zugriff hinweg, gewichtet nach ihrem erwarteten oder tatsächlichen Kapazitätsanteil.
  5. Die Zuweisungen vierteljährlich überprüfen da sich die Nutzungsmuster im Laufe der Zeit verändern.

Teams, die indirekt von dem Modell profitieren – beispielsweise ein Produktteam, dessen Kunden eine von einem anderen Team entwickelte KI-gestützte Funktion nutzen –, werden in der Regel nicht direkt in Rechnung gestellt. Der Nutzen, den sie daraus ziehen, wird über das Produkt erfasst, nicht über eine Kostenverrechnung.

Wie sollten indirekte Kosten und Gemeinkosten bei der Preisgestaltung nach dem Stiftungsmodell behandelt werden?

Indirekte Kosten und Gemeinkosten für ein Grundmodell – wie beispielsweise der Zeitaufwand für die Plattformentwicklung, die Sicherheitsüberwachung, die Modellverwaltung und Lizenzen für Tools – sollten gebündelt und anhand eines einheitlichen Verrechnungsschlüssels auf alle nutzenden Teams verteilt werden. Zu den gängigen Verteilungsschlüsseln gehören der Anteil des Teams am gesamten Inferenzvolumen, die Anzahl der mit dem Modell verbundenen Anwendungen oder eine gleichmäßige Aufteilung auf alle registrierten Nutzer.

Bei der Preisgestaltung für Fundamentmodelle werden Gemeinkosten oft unterschätzt. Die direkten Rechenkosten für die Durchführung von Inferenz sind sichtbar und messbar, doch die versteckten Kosten für die Wartung der Plattform, die Verwaltung von Modellversionen, die Gewährleistung der Compliance und den Support interner Nutzer können erheblich sein. Werden diese Kosten zentral ohne Zuordnung übernommen, bleiben sie für die nutzenden Teams unsichtbar, was die tatsächlichen Kosten der KI verzerrt und es erschwert, Investitionen zu rechtfertigen oder Ineffizienzen zu erkennen.

Ein sinnvoller Ansatz besteht darin, zwei Kostenpools zu definieren. Der erste umfasst die direkten variablen Kosten, die Sie nutzungsabhängig zuordnen. Der zweite umfasst die gemeinsamen Plattformkosten, die Sie nach einer festen, im Voraus mit allen Beteiligten vereinbarten Methode verteilen. Die transparente Offenlegung beider Kostenpools – noch bevor eine vollständige Kostenverrechnung eingeführt ist – hilft den Teams, die Gesamtkosten der Nutzung des gemeinsamen Modells zu verstehen, und bereitet das Unternehmen auf eine im Laufe der Zeit strengere Rechenschaftspflicht vor.

Dies spiegelt wider, wie ausgereift Cloud-Kostenmanagement Programme regeln gemeinsam genutzte Dienste: an erster Stelle steht die Transparenz, an zweiter Stelle die Zuweisung und an dritter Stelle die Rechenschaftspflicht.

Welche Tools und Frameworks unterstützen die Kostenverrechnung bei Grundmodellen?

Zu den Tools und Frameworks, die die Kostenverrechnung für Basismodelle unterstützen, gehören FinOps-Frameworks, Taxonomien des Technology Business Management (TBM), Plattformen für das Cloud-Kostenmanagement sowie Tools zur Beobachtbarkeit von KI. Zusammen bieten diese die erforderlichen Messinstrumente, die Governance-Struktur und die Berichtsebene, um die Kosten der KI-Infrastruktur zu erfassen, zuzuordnen und entsprechende Maßnahmen zu ergreifen.

FinOps- und TBM-Rahmenwerke

Das FinOps-Framework, das ursprünglich für das Cloud-Kostenmanagement entwickelt wurde, lässt sich direkt auf die KI-Infrastruktur anwenden. Es definiert die Bereiche „Inform“, „Optimize“ und „Operate“, was sich wie folgt übersetzen lässt: KI-Kosten sichtbar machen, Verschwendung oder Ineffizienz identifizieren und einen regelmäßigen Governance-Rhythmus etablieren. TBM fügt eine strategische Ebene hinzu, indem es die Kosten der KI-Infrastruktur mit den Diensten, Produkten und Geschäftsergebnissen verknüpft, die diese unterstützt. Dies ist nützlich, wenn Sie Investitionen in Basismodelle gegenüber der Unternehmensleitung oder dem Vorstand rechtfertigen müssen.

Werkzeugoptionen

Was die Werkzeuge betrifft, kombinieren Unternehmen in der Regel mehrere Ebenen:

  • Plattformen für das Cloud-Kostenmanagement Lösungen wie Apptio Cloudability erfassen Rechen- und Speicherkosten auf Ressourcenebene und unterstützen eine tagbasierte Zuordnung über Teams hinweg.
  • Tools zur Beobachtbarkeit von KI Erfassung der Instrumentenmodellnutzung auf Aufrufebene, einschließlich der Anzahl der Token, der Latenz sowie der Benutzer- oder Team-Identifikatoren, die in die Kostenverrechnung einfließen.
  • Interne Showback- oder Chargeback-Dashboards Daten aus Cloud-Abrechnungs- und Überwachungstools zu Kostenberichten auf Teamebene zusammenfassen.
  • TBM-Plattformen wie beispielsweise Apptio Standard, das die Kosten der KI-Infrastruktur in eine geschäftsorientierte Taxonomie abbildet und so die Erstellung von Cost-to-Value-Berichten für Führungskräfte ermöglicht.

Kein einzelnes Tool deckt das gesamte Spektrum ab. Eine effektive Kostenverrechnung auf Basis von Fundamentmodellen erfordert die Verknüpfung von Cloud-Abrechnungsdaten, Nutzungserfassung und einem Governance-Prozess, der sicherstellt, dass die Teams die Informationen regelmäßig überprüfen und entsprechend handeln. Die Technologie ist nur so nützlich wie der dahinterstehende organisatorische Prozess.

So unterstützen wir Sie bei der Kostenverrechnung von Basismodellen

Wir unterstützen Unternehmen dabei, den Übergang von einer ad-hoc-basierten KI-Kostenverfolgung zu einem strukturierten, geregelten Zuordnungsmodell zu vollziehen, das Teams in die Verantwortung nimmt und Ausgaben mit dem geschäftlichen Nutzen verknüpft. Unser Ansatz kombiniert FinOps-Praktiken mit TBM-Frameworks, um Ihnen sowohl die operativen Details als auch den strategischen Kontext zu liefern, den Sie benötigen.

Konkret unterstützen wir Sie bei folgenden Aufgaben:

  • FinOps-Bewertung um Ihren aktuellen Reifegrad bei der Zuordnung gemeinsamer KI- und Cloud-Kosten zu bewerten und festzustellen, wo Lücken in der Verantwortlichkeit bestehen.
  • Gestaltung der Kostenverrechnung um die richtigen Verrechnungsschlüssel, Kostenstellen und Verrechnungs- oder Showback-Mechanismen für Ihre Foundation-Model-Umgebung festzulegen.
  • Implementierung der Werkzeuge durch den Einsatz von Plattformen wie Apptio Cloudability und Apptio Standard, um die Nutzung zu erfassen, die Berichterstellung zu automatisieren und entscheidungsreife Erkenntnisse zu gewinnen.
  • Integration von TBM und FinOps um die Kosten für die KI-Infrastruktur mit den Dienstleistungen und Geschäftsergebnissen zu verknüpfen, die sie unterstützt, und so einen konstruktiven Dialog mit der Finanzabteilung und der Unternehmensleitung zu ermöglichen.
  • Gestaltung der Unternehmensführung um einen regelmäßigen Rhythmus zu etablieren, in dem die Teams aus den Bereichen Finanzen, IT und Technik gemeinsam die KI-Kosten überprüfen und fundierte Entscheidungen treffen.

Wenn Sie bereit sind, Struktur und Verantwortlichkeit in Ihr KI-Kostenmanagement zu bringen, Nehmen Sie Kontakt mit uns auf und wir zeigen Ihnen, wo Sie anfangen können.

Sein Wert
Datenschutz-Übersicht

Diese Website verwendet Cookies, damit wir dir die bestmögliche Benutzererfahrung bieten können. Cookie-Informationen werden in deinem Browser gespeichert und führen Funktionen aus, wie das Wiedererkennen von dir, wenn du auf unsere Website zurückkehrst, und hilft unserem Team zu verstehen, welche Abschnitte der Website für dich am interessantesten und nützlichsten sind.