Apache Ozone vereint die S3-API und das Hadoop File System in einem verteilten Speicher. Die Plattform trennt die Verwaltung von Metadaten und Datenblöcken, hält die Konsistenz über das RAFT-Protokoll und bindet Kerberos, Apache Ranger und Verschlüsselung im Cluster ein.
Mit Apache Ozone lassen sich Dateien und Blöcke in zweistelliger Milliardenanzahl verwalten.
(Bild: Gemini / KI-generiert)
Apache Ozone ist ein Top-Level-Projekt der Apache Software Foundation und richtet sich an Cluster, die Datenmengen jenseits der Grenzen klassischer HDFS-Installationen verwalten. Der Speicher zielt auf zweistellige Milliardenzahlen an Dateien und Blöcken und arbeitet auf physischen Knoten und in containerisierten Umgebungen unter Kubernetes oder YARN. Der Aufbau aus getrennten Diensten, die Zugriffswege über S3 und Hadoop sowie das Sicherheitsmodell prägen den Einsatz im Rechenzentrum.
Getrennte Dienste für Metadaten und Blöcke
Ozone teilt die Verantwortung auf mehrere Dienste auf. Der Ozone Manager (OM) führt den Namensraum aus Volumes, Buckets und Keys und legt die Metadaten in einer RocksDB-Instanz ab. Damit verlässt der Speicher das Modell des HDFS-NameNode, der die gesamten Metadaten im Arbeitsspeicher hält und so die erreichbare Dateizahl begrenzt. Der Storage Container Manager (SCM) verwaltet den Blockraum, organisiert die Container und steuert den Lebenszyklus der Datanodes. Die Datanodes schreiben die Nutzdaten in Container, die als Einheit der Replikation dienen.
Die Konsistenz sichert Apache Ratis, eine Implementierung des RAFT-Protokolls. Über Ratis stimmen die beteiligten Knoten Schreibvorgänge ab und halten die replizierten Kopien synchron. Ein Cluster übersteht damit den Ausfall mehrerer Knoten ohne Datenverlust.
Zugriff über S3 und Hadoop File System
Anwendungen erreichen Ozone über zwei Schnittstellen. Das S3 Gateway stellt eine S3-kompatible API bereit und nimmt Anfragen am Port 9878 entgegen. Bestehende S3-Clients sprechen den Endpunkt ohne Anpassung an und legen darüber Buckets an oder laden Objekte hoch. Parallel bedient Ozone die Hadoop File System API, sodass Analyse-Frameworks aus dem Hadoop-Umfeld direkt auf den Datenbestand zugreifen.
Mit Version 2.0.0 bindet Ozone Apache HBase als erster Objektspeicher an und erlaubt damit Lese- und Schreibzugriffe mit niedriger Latenz neben dem klassischen Objektgeschäft. Atomare Operationen für das Überschreiben und Ersetzen von Keys verbessern die Konsistenz bei nebenläufigen Anwendungen.
Sicherheit, Replikation und Betrieb
Im gesicherten Modus authentifiziert Ozone über Kerberos. Native ACLs regeln den Zugriff auf Volumes, Buckets und Keys, die Anbindung an Apache Ranger zentralisiert die Vergabe der Berechtigungen über mehrere Dienste hinweg. Transparent Data Encryption (TDE) verschlüsselt die Daten im Ruhezustand, eine Transportverschlüsselung sichert die Übertragung zwischen den Knoten.
Den Grad der Redundanz legt ein Replikationsfaktor fest. In der Standardkonfiguration eines Test-Clusters steht der Faktor auf 1, über die Umgebungsvariable „OZONE_REPLICATION_FACTOR“ lässt sich der Wert anheben. Für den Einstieg liefert das Projekt eine Docker-Compose-Konfiguration, die einen kompletten Cluster startet. Vorbereitete Kubernetes-Ressourcen decken den Betrieb in orchestrierten Umgebungen ab, der Build aus dem Quellcode gelingt über Apache Maven.
Fazit
Ozone verbindet die S3-API mit dem Hadoop File System und löst die Metadaten-Begrenzung des HDFS-NameNode durch eine getrennte, RocksDB-gestützte Verwaltung. Mit der HBase-Anbindung und atomaren Key-Operationen seit Version 2.0.0 deckt der Speicher analytische Workloads und latenzkritische Zugriffe aus einer Plattform ab. Die aktuelle Version 2.1.0 setzt diese Ausrichtung fort und bindet Kerberos, Ranger und Verschlüsselung im Ruhezustand und auf der Leitung ein.
Aktuelles E-Book
Open-Source-Storage – Speicher-Software zum Nulltarif
E-Book „Open-Source-Storage“
(Bild: Storage-Insider)
Der Bedarf an Speicherkapazität steigt von Tag zu Tag – nicht nur, um die Daten von Produkten, Kunden und Transaktionen zu sichern, sondern auch, um Compliance-Anforderungen zu erfüllen und Auditierungen gut zu überstehen. Eine leistungsfähige Storage-Lösung ist also gefragt. Eine kostenlose Option bietet Open-Source-Software für Storage, insbesondere dann, wenn man sie selbst den eigenen Anforderungen anpassen darf.
Es ist für uns eine Selbstverständlichkeit, dass wir verantwortungsvoll mit Ihren personenbezogenen Daten umgehen. Sofern wir personenbezogene Daten von Ihnen erheben, verarbeiten wir diese unter Beachtung der geltenden Datenschutzvorschriften. Detaillierte Informationen finden Sie in unserer Datenschutzerklärung.
Einwilligung in die Verwendung von Daten zu Werbezwecken
Ich bin damit einverstanden, dass die Vogel IT-Medien GmbH, Max-Josef-Metzger-Straße 21, 86157 Augsburg, einschließlich aller mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen (im weiteren: Vogel Communications Group) meine E-Mail-Adresse für die Zusendung von Newslettern und Werbung nutzt. Auflistungen der jeweils zugehörigen Unternehmen können hier abgerufen werden.
Der Newsletterinhalt erstreckt sich dabei auf Produkte und Dienstleistungen aller zuvor genannten Unternehmen, darunter beispielsweise Fachzeitschriften und Fachbücher, Veranstaltungen und Messen sowie veranstaltungsbezogene Produkte und Dienstleistungen, Print- und Digital-Mediaangebote und Services wie weitere (redaktionelle) Newsletter, Gewinnspiele, Lead-Kampagnen, Marktforschung im Online- und Offline-Bereich, fachspezifische Webportale und E-Learning-Angebote. Wenn auch meine persönliche Telefonnummer erhoben wurde, darf diese für die Unterbreitung von Angeboten der vorgenannten Produkte und Dienstleistungen der vorgenannten Unternehmen und Marktforschung genutzt werden.
Meine Einwilligung umfasst zudem die Verarbeitung meiner E-Mail-Adresse und Telefonnummer für den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern wie z.B. LinkedIN, Google und Meta. Hierfür darf die Vogel Communications Group die genannten Daten gehasht an Werbepartner übermitteln, die diese Daten dann nutzen, um feststellen zu können, ob ich ebenfalls Mitglied auf den besagten Werbepartnerportalen bin. Die Vogel Communications Group nutzt diese Funktion zu Zwecken des Retargeting (Upselling, Crossselling und Kundenbindung), der Generierung von sog. Lookalike Audiences zur Neukundengewinnung und als Ausschlussgrundlage für laufende Werbekampagnen. Weitere Informationen kann ich dem Abschnitt „Datenabgleich zu Marketingzwecken“ in der Datenschutzerklärung entnehmen.
Falls ich im Internet auf Portalen der Vogel Communications Group einschließlich deren mit ihr im Sinne der §§ 15 ff. AktG verbundenen Unternehmen geschützte Inhalte abrufe, muss ich mich mit weiteren Daten für den Zugang zu diesen Inhalten registrieren. Im Gegenzug für diesen gebührenlosen Zugang zu redaktionellen Inhalten dürfen meine Daten im Sinne dieser Einwilligung für die hier genannten Zwecke verwendet werden. Dies gilt nicht für den Datenabgleich zu Marketingzwecken.
Recht auf Widerruf
Mir ist bewusst, dass ich diese Einwilligung jederzeit für die Zukunft widerrufen kann. Durch meinen Widerruf wird die Rechtmäßigkeit der aufgrund meiner Einwilligung bis zum Widerruf erfolgten Verarbeitung nicht berührt. Um meinen Widerruf zu erklären, kann ich als eine Möglichkeit das unter https://contact.vogel.de abrufbare Kontaktformular nutzen. Sofern ich einzelne von mir abonnierte Newsletter nicht mehr erhalten möchte, kann ich darüber hinaus auch den am Ende eines Newsletters eingebundenen Abmeldelink anklicken. Weitere Informationen zu meinem Widerrufsrecht und dessen Ausübung sowie zu den Folgen meines Widerrufs finde ich in der Datenschutzerklärung.