MODUS: Model Orchestration, Definitions & Usage. Secured.

Das KI-Gateway für Azure: Jede Abteilung nutzt KI, Sie sehen die Kosten pro Projekt.

MODUS bündelt alle KI-Anwendungen Ihres Unternehmens an einer Stelle und läuft auf Kubernetes: in Ihrem eigenen Azure-Tenant, on-premises oder in einer anderen Cloud, ohne Bindung an einen Cloud-Anbieter. Sie legen fest, welches Modell jede Anwendung nutzt, wie viel sie verbrauchen darf und was gespeichert wird.

Läuft produktiv bei einem internationalen Pharmakonzern.

01Problem

Warum KI-Nutzung ohne zentrale Stelle schwer zu kontrollieren ist

Ohne zentrale Stelle stecken Modellwahl, Systemnachricht, API-Schlüssel und Protokollierung in jeder Anwendung einzeln, und niemand sieht die KI-Nutzung als Ganzes. Teilen sich mehrere Anwendungen ein Azure-OpenAI-Deployment, zeigt die Azure-Rechnung nicht, welches Projekt wie viele Tokens verbraucht hat. Ein Modellwechsel wird zur Codeänderung in jeder betroffenen Anwendung. Ein Pilot, der im März enden sollte, läuft weiter, bis jemand den Schlüssel sperrt.

Gleichzeitig nutzen Beschäftigte KI am offiziellen Weg vorbei. 42 Prozent der Unternehmen ab 20 Beschäftigten wissen oder vermuten, dass generative KI wie ChatGPT über private Zugänge im Job eingesetzt wird. Einen eigenen Zugang stellen 26 Prozent bereit, bei Unternehmen mit 100 bis 499 Beschäftigten sind es 36 Prozent (Bitkom, Oktober 2025). Diese Schatten-KI wächst dort, wo ein offizieller Weg fehlt.

ISO 27001 verlangt Regeln für die Nutzung von Cloud-Diensten (Anhang A 5.23) und die Protokollierung relevanter Aktivitäten (Anhang A 8.15). Für externe KI-Dienste heißt das: Sie müssen beantworten können, welche Anwendung welchen Dienst mit welchen Vorgaben nutzt. Ohne zentrale Stelle geht das nur Anwendung für Anwendung.

02So arbeitet MODUS

Wie MODUS KI-Dienste aus Azure und darüber hinaus bereitstellt

MODUS steht zwischen Ihren Anwendungen und den KI-Diensten und läuft in Ihrem Azure-Tenant. Welche Dienste ein Projekt nutzt, richtet sich nach seinen Anforderungen, vom Machine-Learning-Modell bis zum Sprachmodell. Für Sprachmodelle arbeitet MODUS als Azure OpenAI Gateway: Anwendungen rufen kein Modell direkt auf, sondern eine LLM-Definition, die Sie zentral pflegen.

LLM-Definitionen

Eine Definition legt fest, welches Modell genutzt wird, welche Systemnachricht es erhält, welche Nutzungsgrenzen gelten und wie lange die Definition gültig ist. Standardmäßig kommen die Sprachmodelle aus Azure OpenAI. Wollen Sie Microsoft Foundry umgehen, bindet MODUS auch Anbieter außerhalb von Azure an, etwa Anthropic, Mistral, die OpenAI-API oder Dienste wie OpenRouter.

Zentrale API

Für Sprachmodelle erzeugen Ihre Anwendungen Completions über die MODUS-API auf Basis einer Definition. MODUS leitet die Anfrage an das Modell weiter, das in der Definition hinterlegt ist.

Protokoll, Verbrauch und Chat-Sitzungen

Jede KI-Anfrage läuft über MODUS und wird dort erfasst. Was davon gespeichert wird, legen Sie fest: Completions und Chats können dauerhaft gespeichert werden, nur flüchtig im Arbeitsspeicher liegen oder gar nicht gespeichert werden. Im letzten Fall bleiben nur Metadaten wie der Tokenverbrauch. Bei dauerhafter Speicherung entfernt MODUS den Bezug zu Benutzer und Sitzung. Den Tokenverbrauch ordnet MODUS dem jeweiligen Projekt zu. Chat-Sitzungen verwaltet MODUS ebenfalls zentral, statt dass jede Anwendung sie selbst führt.

Werkzeuge und Unternehmensdaten

MODUS unterstützt Retrieval Augmented Generation (RAG) und das Model Context Protocol (MCP). Aus Azure binden Sie Azure AI Search und Azure Document Intelligence an: Document Intelligence liest Text und Tabellen aus PDFs, Scans und Formularen aus, Azure AI Search findet die passenden Stellen, damit ein Modell auf Grundlage Ihrer Dokumente antwortet.

Ablauf für ein Sprachmodell

  1. Sie legen eine LLM-Definition an: Modell, Systemnachricht, Nutzungsgrenzen, Gültigkeit.
  2. Eine Anwendung ruft über die MODUS-API eine Completion zu dieser Definition ab.
  3. MODUS prüft Gültigkeit und Nutzungsgrenzen, leitet die Anfrage an das Modell weiter und erfasst sie im Protokoll.

03Ergebnis

Was sich für IT-Leitung und Entwicklung ändert

Modellwahl, Systemnachrichten, Nutzungsgrenzen und Speicherregeln liegen an einer Stelle, und jede KI-Anfrage ist dort nachvollziehbar.

Was sich für IT-Leitung und Entwicklung ändert
Ohne zentrale StelleMit MODUS
Modell wechselnCodeänderung in jeder AnwendungÄnderung in der LLM-Definition
Systemnachrichtenim Code der einzelnen Anwendungenzentral in der Definition
NutzungsgrenzenKontingent pro Azure-OpenAI-Deployment, nicht pro Anwendungpro Definition
Verbrauch pro Projektbei gemeinsam genutztem Deployment nicht erkennbarTokenverbrauch pro Projekt
Ende eines PilotenZugang läuft weiter, bis ihn jemand sperrtDefinition läuft zum festgelegten Zeitpunkt ab
Speicherung von Anfragenje Anwendung unterschiedlichzentral festgelegt: dauerhaft, flüchtig oder nur Metadaten
NachvollziehbarkeitProtokolle, soweit jede Anwendung sie schreibtein zentrales Protokoll aller KI-Anfragen
RAG und MCPin jeder Anwendung eigens umgesetztzentral in MODUS

Wenn Sie Ihren Beschäftigten eigene KI-Anwendungen als Alternative zu privaten Zugängen anbieten, laufen diese alle über denselben freigegebenen Weg.

MODUS läuft produktiv im Azure-Tenant eines internationalen Pharmakonzerns, stellt dort allen Projekten die KI-Modelle zentral bereit und ordnet den Tokenverbrauch dem jeweiligen Projekt zu.

MODUS können Sie selbst betreiben oder den laufenden Betrieb im Rahmen von ASTRA an uns übergeben.

04Passt zu Ihnen

Für wen MODUS gedacht ist

MODUS passt, wenn

  • mehrere Projekte KI-Dienste aus Azure nutzen oder bald nutzen sollen,
  • Ihre IT festlegen soll, welche Anwendung welches Modell in welchem Umfang nutzt,
  • Sie dafür kein eigenes API Management aufbauen wollen,
  • Sie KI-Piloten mit festem Enddatum starten,
  • Ihr Datenschutzbeauftragter mitentscheiden soll, ob Inhalte von KI-Anfragen gespeichert werden,
  • Sie für ISO 27001 oder TISAX zeigen müssen, welche Anwendungen welche KI-Dienste nutzen,
  • Ihr Team RAG und MCP nicht in jeder Anwendung neu umsetzen soll,
  • Sie den Tokenverbrauch einzelnen Projekten zuordnen wollen.

05Preis

Was kostet MODUS?

Die Einrichtung in Ihrem Azure-Tenant kostet einmalig 7.500 EUR. Danach richtet sich die Lizenz danach, wie viele Projekte MODUS nutzen. Alle Preise netto.

Einrichtung, einmalig

7.500 EUR

Aufbau von MODUS in Ihrer Azure-Subscription, mit Umgebungen für Integration, Test und Produktion, und Einweisung Ihres Teams. Dauer: rund ein Monat.

bis 5 Projekte

1.499 EUR

/ Monat

bis 15 Projekte

Am häufigsten gewählt

2.499 EUR

/ Monat

unbegrenzt

3.999 EUR

/ Monat

Die Lizenz umfasst die Nutzung von MODUS sowie Feature- und Security-Updates. Sie läuft ein Jahr und verlängert sich um ein weiteres Jahr, wenn Sie nicht drei Monate vor Laufzeitende kündigen. MODUS läuft in Ihrem eigenen Azure-Tenant, und Ihre Daten bleiben unter Ihrer Kontrolle. Nicht enthalten ist der Azure-Verbrauch in Ihrem Tenant, etwa für Modelle und Infrastruktur. Den laufenden Betrieb können Sie selbst übernehmen oder im Rahmen von ASTRA an uns übergeben. Die Zahl der Nutzer und Anwendungen spielt für den Preis keine Rolle. Für die Übergabe des Quellcodes und für konzernweite Nutzung über mehrere Tenants erstellen wir ein Angebot.

MODUS ist derzeit für Early Adopters verfügbar, die es direkt bei uns anfragen. Über den Microsoft Marketplace soll MODUS ab 2027 erhältlich sein.

06FAQ

Häufige Fragen zu MODUS

Was ist ein KI-Gateway?

Ein KI-Gateway ist eine zentrale Schicht zwischen Anwendungen und KI-Modellen. Anwendungen sprechen nicht direkt mit einem Anbieter, sondern mit dem Gateway, das Zugriff, Nutzung und Protokollierung an einer Stelle regelt. MODUS ist ein KI-Gateway für Azure, läuft in Ihrem eigenen Azure-Tenant und verwaltet zusätzlich LLM-Definitionen, Chat-Sitzungen und die Anbindung von RAG.

Was ist eine LLM-Definition?

Eine LLM-Definition ist der Eintrag in MODUS, über den eine Anwendung ein Sprachmodell nutzt. Sie enthält Modell, Systemnachricht, Nutzungsgrenzen und Gültigkeitsdauer. Ändern Sie die Definition, gilt die Änderung für jede Anwendung, die sie nutzt.

Wir nutzen Microsoft Foundry. Wozu brauchen wir MODUS?

Microsoft Foundry (früher Azure AI Foundry) stellt die Modelle und KI-Dienste bereit. MODUS regelt, wie Ihre Projekte sie nutzen: welche Dienste ein Projekt bekommt, mit welchen Nutzungsgrenzen und welchen Verbrauch es verursacht. Dazu kommen LLM-Definitionen mit Systemnachricht und Gültigkeitsdauer, Chat-Sitzungen und die Anbindung von Azure AI Search und Azure Document Intelligence.

Worin unterscheidet sich MODUS vom AI Gateway in Azure API Management?

Das AI Gateway in Azure API Management setzt eine eingerichtete API-Management-Instanz voraus, die viele Unternehmen erst aufbauen müssten. MODUS braucht kein API Management und lässt sich später dahinterhängen, wenn Sie eines einführen. MODUS steuert außerdem feiner: Eine LLM-Definition enthält neben Modell und Nutzungsgrenzen auch Systemnachricht und Gültigkeitsdauer, und der Verbrauch wird jedem Projekt zugeordnet. Weil MODUS auf Kubernetes läuft, ist es zudem nicht an Azure gebunden.

Welche KI-Dienste und Anbieter unterstützt MODUS?

MODUS stellt alle KI-Dienste bereit, die in Azure verfügbar sind, vom Machine-Learning-Modell bis zum Sprachmodell aus Azure OpenAI. Welche davon ein Projekt nutzt, richtet sich nach seinen Anforderungen. Wollen Sie Microsoft Foundry umgehen, bindet MODUS auch Anbieter außerhalb von Azure an, etwa Anthropic, Mistral, die OpenAI-API oder Dienste wie OpenRouter.

Was zählt als Projekt?

Ein Projekt ist eine Anwendung oder ein Vorhaben mit eigener Kostenzuordnung in MODUS. Nutzt eine Abteilung dieselbe Kostenzuordnung für mehrere Anwendungen, ist das ein Projekt. Wie viele Nutzer und Anwendungen dahinterstehen, spielt für den Preis keine Rolle.

Was passiert, wenn wir die Lizenz nicht verlängern?

Zum Ende der Laufzeit wird MODUS deaktiviert. Die MODUS-Datenbank mit Ihren Definitionen und Einstellungen liegt in Ihrer Subscription und bleibt dort.

Kann MODUS den KI-Verbrauch einzelnen Projekten zuordnen?

Ja. MODUS erfasst den Tokenverbrauch jeder Anfrage und ordnet ihn dem jeweiligen Projekt zu. Damit ist nachvollziehbar, welches Projekt wie viele Tokens verbraucht, auch wenn sich mehrere Anwendungen ein Azure-OpenAI-Deployment teilen. Das ist die Grundlage, um KI-Kosten intern zu verrechnen.

Was speichert MODUS von Ihren KI-Anfragen?

Das legen Sie fest. Completions und Chats können dauerhaft gespeichert werden, nur flüchtig im Arbeitsspeicher liegen oder gar nicht gespeichert werden. Im letzten Fall bleiben nur Metadaten wie der Tokenverbrauch. Bei dauerhafter Speicherung entfernt MODUS den Bezug zu Benutzer und Sitzung, die Inhalte der Chats bleiben unverändert. Sollen keine Inhalte dauerhaft liegen, wählen Sie die flüchtige Speicherung oder nur Metadaten.

Wo läuft MODUS?

Standardmäßig in einer Azure-Subscription in Ihrem eigenen Tenant, auf Azure Kubernetes Service mit getrennten Umgebungen für Integration, Test und Produktion. Definitionen und Einstellungen liegen in einer MODUS-Datenbank in derselben Subscription. Weil MODUS auf Kubernetes läuft, lässt es sich auch on-premises oder in einer anderen Cloud betreiben. Den laufenden Betrieb können Sie selbst übernehmen oder im Rahmen von ASTRA an uns übergeben.

ASTRA: Azure Managed Service

Was brauchen wir für die Einrichtung?

Eine Azure-Subscription, in die wir MODUS deployen, und Ihre Vorgaben zu Domain und Zertifikaten. Den Aufbau übernehmen wir vollständig per Bicep, er dauert rund einen Monat.

Wie nutzt MODUS Azure AI Search und Azure Document Intelligence?

Azure Document Intelligence liest Text, Tabellen und Strukturen aus PDFs, Scans und Formularen aus. Azure AI Search durchsucht diese Inhalte. MODUS bindet beide Dienste an, damit ein Modell Fragen auf Grundlage Ihrer eigenen Dokumente beantwortet, etwa zu Wartungsanleitungen oder Prüfprotokollen. Dieses Verfahren heißt Retrieval Augmented Generation (RAG).

Ist MODUS ein Produkt von Microsoft?

Nein. MODUS ist ein Produkt der DEVDEER GmbH. DEVDEER ist Microsoft Cloud Solution Provider.

MODUS für Ihre KI-Anwendungen besprechen

Im Architekturgespräch klären wir, welche Anwendungen heute welche KI-Dienste nutzen, was Sie von KI-Anfragen speichern wollen und wie MODUS in Ihren Azure-Tenant passt.

Nächster Schritt

Bereit, Wirkung zu entfalten?

Erzählen Sie uns kurz, worum es geht – per Mail oder in einem unverbindlichen Gespräch. Wir hören zu, fragen nach und zeigen, wie wir lösungsorientiert und pragmatisch helfen können.

So geht es weiter

  1. 01

    Anliegen schildern

    Drei Felder, keine Anmeldung. Zwei Minuten reichen.

  2. 02

    Persönliche Rückmeldung

    Stefanie Heine meldet sich innerhalb eines Werktags bei Ihnen.

  3. 03

    Unverbindliches Erstgespräch

    Wir hören zu, fragen nach und zeigen, wie wir helfen können.

Lieber direkt einen Termin wählen?

Ihre Ansprechpartnerin

Stefanie Heine

Stefanie Heine

Executive Assistant

0/500 Zeichen

Wir antworten innerhalb eines Werktags

Microsoft Certified Expert Badge50+ Kunden vertrauen DEVDEERAzure seit 2015Microsoft Cloud Solution Provider