KI-Datensätze brauchen deutlich mehr Pflege als klassische Unternehmensdaten. Der Grund: Sie funktionieren nur zusammen. Schon kleine Abweichungen, ob vorsätzlich oder versehentlich verursacht, können großen Schaden anrichten. Aktuelle Cloud-Storage-Lösungen werden dem oft nicht gerecht.
Wer einen tatsächlichen Mehrwert aus KI-Investitionen ziehen will, muss verhindern, dass die Kosten aus dem Ruder laufen, und den Blick auf die Basis richten: die Storage-Architektur.
(Bild: KI-generiert)
In Deutschland gibt es heute kaum noch ein Unternehmen, das nicht in irgendeiner Form Cloud-Speicher nutzt. Ziel der Datenmigration war es, flexibler, schneller und oft auch günstiger zu arbeiten. In der Praxis hat sich das aber nur teilweise bewahrheitet, denn mit der Entscheidung folgte ein Abrechnungsmodell, das sich oft erst im Betrieb als nachteilig für genau jene Workloads erwies, zu deren Schutz es eingeführt wurde.
Diese Diskrepanz wird im KI-Zeitalter umso deutlicher. Unternehmen investieren massiv in die neue Technologie. Auch hier besteht das Ziel meist darin, effizienter zu werden und Kosten zu senken. Viele sind davon allerdings noch weit entfernt. Wer einen tatsächlichen Mehrwert aus KI-Investitionen ziehen will, muss sich deshalb zwei zentrale Fragen stellen: Was passiert mit den Datenbeständen, die KI-Systeme laufend erzeugen? Und welche Anforderungen entstehen daraus für Storage-Architekturen?
Der Mehrwert von KI bleibt oft noch aus
US-amerikanische Tech-Konzerne haben die Erwartungen an KI-Tools ins Unermessliche wachsen lassen. Nvidia-Chef Jensen Huang soll gesagt haben, seine Teams seien verrückt, wenn sie KI nicht für möglichst viele Aufgaben einsetzen würden.
Außerhalb des Silicon Valley sieht die Realität noch anders aus. Zwar bleibt die Investition in KI-Projekte für viele Unternehmen eine klare Priorität, und 59 Prozent wollen die bereitgestellten Mittel sogar noch erhöhen. Bisher konnte jedoch nur knapp ein Drittel einen positiven Return on Investment (ROI) feststellen. Das geht aus unserer eigenen globalen Studie hervor, für die weltweit 1.700 Fach- und Führungskräfte aus Wirtschaft und IT befragt wurden. Ein wesentlicher Grund: Der Großteil der KI-Budgets fließt nicht in die Anwendungen selbst, sondern in Daten, Speicherplatz und Rechenleistung. 45 Prozent der befragten europäischen Unternehmen haben ihr Cloud-Budget im Jahr 2025 deshalb überschritten – meist aufgrund unerwarteter Gebühren.
Kosten für KI-Nutzung sind unerwartet hoch
Eine Umfrage des Branchenverbandes Bitkom bestätigt das: Demnach wurde in Deutschland rund ein Drittel der Unternehmen von den hohen KI-Kosten überrascht. Vor diesem Hintergrund stellt sich zunehmend die Frage, was mit den Daten passieren muss, die KI-Systeme laufend erzeugen. Fakt ist: Trainingsdaten, Modellversionen, Embeddings, Vektordatenbanken, Prompt-Historien und Agenten-Logs werden immer geschäftskritischer. Sie sind die operative Grundlage dafür, dass KI-Systeme zuverlässig und nachvollziehbar funktionieren können. Trotzdem werden sie häufig nicht mit derselben Konsequenz erfasst, geschützt und wiederherstellbar gemacht wie klassische Unternehmensdaten.
Die Gründe dafür sind vielfältig. Etablierte Backup-Konzepte wurden für Dateien, Datenbanken und Anwendungen entwickelt – nicht für sehr große, sich häufig ändernde KI-Datensätze mit komplexen Abhängigkeiten. Während der Verlust einer Kundendatenbank sofort offensichtlich ist, bleibt der Schaden durch ein beschädigtes Embedding-Modell oder eine fehlende Prompt-Historie abstrakt. Dass KI-Projekte meist von Data-Science- oder Produktteams vorangetrieben werden, die schnell Ergebnisse liefern wollen, kommt erschwerend hinzu. Storage-, Backup- und Security-Teams werden dabei oft zu spät einbezogen. Das Ergebnis: Niemand fühlt sich für KI-Daten zuständig, weil definierte Prozesse fehlen. So wachsen Datenbestände außerhalb etablierter Storage-, Backup- und Governance-Strukturen heran, und eine neue Form von Schatten-IT entsteht.
Komplexe KI-Datensätze funktionieren anders
KI-Datensätze folgen anderen Regeln als klassische Unternehmensdaten. Trainingsdaten wachsen nicht linear, sondern sprunghaft. Jeder neue Trainingslauf erzeugt eine neue Modellversion, und jede Aktualisierung der Wissensbasis verändert die Embeddings und Vektordatenbanken. In der klassischen IT gilt ein System als erfolgreich wiederhergestellt, wenn Infrastruktur, Datenbank und Anwendung laufen.
Bei KI-Systemen reicht das nicht aus. Diese Datenklassen funktionieren nur gemeinsam: Ein Modell ohne die passenden Embeddings oder Embeddings ohne die zugrunde liegenden Trainingsdaten ergeben nach einer Wiederherstellung keinen konsistenten Zustand. Das Tückische daran ist, dass der Fehler nicht sofort auffällt. Das System läuft zwar, aber die Inkonsistenz zeigt sich erst in der mangelhaften Qualität der Ausgaben. Das eigentliche Problem von KI-Datensätzen ist deshalb nicht allein das enorme Volumen, sondern die Abhängigkeiten zwischen den Komponenten.
Stand: 08.12.2025
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.
Storage-Architekturen müssen mit dieser Komplexität mithalten können. Klassische On-Premises-Lösungen stoßen dabei schnell an ihre Grenzen. Doch auch Cloud-Storage stellen Unternehmen im KI-Zeitalter vor neue Herausforderungen. Zwar werden die Probleme steigender Hardware-Kosten und langer Lieferzeiten gelöst, allerdings wurde ein Abrechnungsmodell eingeführt, dessen Schwächen die meisten Teams erst im laufenden Betrieb bemerkten. Cold- und Archiv-Speicher sind auf seltenen Zugriff ausgelegt und im Ruhezustand günstig. Backup- und Recovery-Workloads erfordern jedoch das Gegenteil – nämlich häufigen und sofortigen Zugriff. Für KI-Workloads gilt das umso mehr: Sie benötigen jederzeit Zugang zu Trainingsdaten während neuer Trainingsläufe, zu Embeddings bei jedem Inferenzvorgang und zu Modellversionen bei Validierungen. Wenn jeder Zugriff Geld kostet, werden Recovery-Tests aufgeschoben und Validierungen übersprungen. Es entsteht dieselbe Verhaltenslücke, die schon von klassischen Backups bekannt ist – mit dem Unterschied, dass das Risiko bei Fehlern und Datenverlusten bei KI-Systemen umso höher ist.
KI legt Probleme mit Cloud-Storage offen
Auch die Sorge um die Cloud-Sicherheit bleibt hoch und wird durch die Komplexität neuer KI-Systeme weiter verstärkt. Laut Umfrage sind schon fast die Hälfte der deutschen Unternehmen Opfer eines Cyberangriffs geworden, in dessen Folge der Zugriff auf Daten in der Public Cloud verloren ging. Was bei klassischen Unternehmensdaten bereits erheblichen Schaden anrichtet, wiegt bei komplexen Abhängigkeiten zwischen KI-Trainingsdaten, Modellversionen und Prompt-Historien noch schwerer.
Aber auch intern können sich versehentliche Fehler als folgenschwer erweisen: In vielen KI-Projekten liegen Trainingsdaten und Modellversionen in denselben Umgebungen wie die aktiven Systeme – ohne Schreibschutz. Object Lock ist die technische Antwort darauf. Dieser Mechanismus macht Daten für einen definierten Zeitraum unveränderlich. Er sollte standardmäßig für alle sicherungskritischen KI-Datenklassen aktiviert sein.
Die Probleme unsicherer und teurer Storage-Architekturen bestehen zwar schon länger, treten im KI-Zeitalter, in dem große Datenmengen in komplexen Abhängigkeiten stehen, aber besonders deutlich zutage. Bestehende Preismodelle können dem nicht gerecht werden. Wer sicherstellen möchte, dass sich KI-Investitionen in einem positiven ROI bemerkbar machen, muss sich aktiv für ein Speichermodell ohne Egress-Gebühren, ohne API-Kosten und ohne Abrufaufschläge entscheiden. Wenn das Wiederherstellen, Testen und Validieren von KI-Datensätzen keine Zusatzkosten mehr verursacht, wird daraus eine Routine – und genau das schafft die Resilienz, die Unternehmen benötigen, um aus ihren KI-Investitionen tatsächlich mehr Effizienz zu ziehen.
Marco Pfuhl, Country Manager DACH, Wasabi.
(Bild: Wasabi)
* Der Autor: Marco Pfuhl ist Country Manager für Deutschland, Österreich und die Schweiz bei Wasabi Technologies und verantwortlich für Wachstum und Marktentwicklung im Bereich Cloud-Speicher in diesen Ländern. Zuvor war er in verschiedenen Vertriebs- und Führungspositionen bei anderen Unternehmen tätig.
Aktuelles E-Book
Ransomware-Schutz durch Object Lock und WORM
E-Book „Ransomware-Schutz“
(Bild: Storage-Insider)
Um ein Storage-System effektiv von Ransomware-Angriffen zu schützen, bieten sich neben Backup/Disaster Recovery und Verschlüsselung vor allem Object Lock und WORM an. Das gelingt nicht nur im eigenen Haus, sondern auch in der Hybrid-Cloud.