Data Lakehouse
Eine souveräne Datenbasis für BI und AI – offen für jede Datenquelle und jedes Format.
Verlässliche AI beginnt mit verlässlichen Daten.
Daten aus ERP, CRM, Fachsystemen, Dokumenten und IoT bleiben nicht in getrennten Silos. AltaSigma führt sie zusammen, bereitet sie für unterschiedliche Anwendungen auf und stellt sie kontrolliert für BI, Machine Learning und AI Agents bereit.
Datenquellen zentral zusammenführen
Bestehende Systeme und Datenquellen lassen sich über direkte Anbindungen und Datenpipelines in einer gemeinsamen Datenbasis zusammenführen.
Eine Datenbasis für BI und AI
Harmonisierte Daten bilden die Grundlage für Analytics und AI – von Machine Learning und Deep Learning bis zu AI Agenten. Eine offene Architektur macht sie für unterschiedlichste Technologien nutzbar.
Offen bleiben, ohne sich festzulegen
Offene Datenformate und standardisierte Schnittstellen schaffen technologische Freiheit. So bleibt Ihre Datenbasis flexibel nutzbar – mit unterschiedlichen Analyse-, Machine Learning- und AI-Technologien.
Zugriffe zentral steuern
Rollen und Rechte legen fest, wer welche Daten nutzen darf. Die Zugriffsregeln gelten durchgängig – in der Benutzeroberfläche, in Notebooks und in AI-Anwendungen.
Von der Datenquelle zum AI-Workload: Das AltaSigma Data Lakehouse führt Daten aus unterschiedlichsten Quellen in einer offenen Architektur zusammen und stellt sie kontrolliert für BI, Machine Learning und AI Agenten bereit.
Der Datenfluss verläuft von unten nach oben: Datenquellen, Ingestion, Bronze für Rohdaten und Staging, Silver für harmonisierte Daten, Gold für kuratierte Daten. Darüber nutzen AI Agents, Deep Learning, Machine Learning und BI die aufbereiteten Daten. Offene Formate sowie zentrale Rollen und Rechte bilden eine gemeinsame Grundlage.
Kuratierte Daten
Für Ihre Analysen und KI-Anwendungsfälle aufbereitet.
Harmonisierte Daten
Daten bereinigen, vereinheitlichen und verknüpfen.
Rohdaten & Staging
Quelldaten aufnehmen und nachvollziehbar ablegen.
So arbeiten Sie mit dem Data Lakehouse
Datenquellen verbinden.
Das AltaSigma Data Lakehouse integriert bestehende Datenquellen über direkte Anbindungen und flexible Datenpipelines. Zentrale Zugriffsrechte sorgen dafür, dass Daten kontrolliert für Teams und Anwendungen bereitstehen.
Bestehende Datenablagen direkt anbinden
Direkte Anbindungen und Datenpipelines erschließen praktisch jedes Quellsystem. S3-kompatibler Objektspeicher und Azure Blob Storage lassen sich direkt integrieren und über das zentrale Data Management verfügbar machen.
Weitere Quellsysteme integrieren
Datenpipelines erschließen Daten aus Datenbanken, Data Warehouses und Fachsystemen. Auch kontinuierliche Ereignisdaten, etwa aus Kafka, lassen sich direkt in die gemeinsame Datenbasis integrieren.
Zugriffe zentral steuern
Rollen und Rechte definieren, welche Teams auf welche Datenquellen zugreifen dürfen. Der zentrale Datenzugang setzt diese Berechtigungen durch – in der Benutzeroberfläche ebenso wie in Notebooks und AI-Anwendungen.
Daten aufbereiten und Pipelines entwickeln.
Datenbestände prüfen, aufbereiten und zu wiederverwendbaren Verarbeitungsschritten verbinden. Von der Datenvorschau über die Entwicklung in der Workbench bis zur automatisierten Ausführung läuft alles integriert auf einer Plattform.
| kunden_id | kaeufe_12m | umsatz_12m |
|---|---|---|
| K-1001 | 12 | 420.50 |
| K-1002 | 8 | 289.00 |
| K-1003 | 24 | 865.20 |
| K-1004 | 5 | 156.80 |
Datenbestände qualifizieren und prüfen
Datenquellen, Buckets, Ordner und Dateien lassen sich direkt durchsuchen und in der Vorschau prüfen. Metadaten können zentral gepflegt werden – für einen schnellen Überblick über verfügbare Daten, ihre Struktur und ihre Eignung für die weitere Verarbeitung.
Daten mit den passenden Werkzeugen aufbereiten
Ob Python, PySpark oder No-Code: Die AI Workbench bietet die passenden Werkzeuge für unterschiedliche Anforderungen. Daten lassen sich flexibel bereinigen, harmonisieren und verknüpfen und für AI-Modelle gezielt weiterverarbeiten.
Datenpipelines entwickeln und automatisieren
Aus einzelnen Verarbeitungsschritten entstehen wiederverwendbare Datenpipelines, die sich zentral orchestrieren und automatisieren lassen. Das AltaSigma Orchestration Modul steuert Ausführung und Zeitplanung – damit aufbereitete Daten automatisch dort bereitstehen, wo sie gebraucht werden.
Aufbereitete Daten für KI & BI nutzen.
Eine gemeinsame Datenbasis versorgt AI Agents, Machine Learning und BI mit aufbereiteten Daten. So lassen sich unterschiedliche Workloads auf offenen Standards, mit zentraler Governance und unter voller Datenhoheit betreiben.
AI Agents
AI Agents nutzen Unternehmensdaten und Dokumente innerhalb klar definierter Zugriffsrechte. So bleibt jederzeit steuerbar, auf welche Informationen ein Agent zugreifen darf – für Kennzahlen, Recherchen und Antworten auf Basis des freigegebenen Unternehmenswissens.
Machine Learning & Deep Learning
Aufbereitete Daten stehen in der passenden Struktur für Training und Inferenz von Machine-Learning- und Deep-Learning-Modellen bereit – von Prognosen und Anomalieerkennung bis zur visuellen Qualitätsprüfung mit Bilddaten.
Business Intelligence
Harmonisierte Daten bilden die Grundlage für Analysen, Berichte und Dashboards. Aktuelle Daten schaffen eine konsistente Sicht auf Kennzahlen und Entwicklungen – als Basis für datenbasierte Entscheidungen.
Data Lakehouse in der Praxis
Wie ein Finanzdienstleister tausende Datenpunkte für personalisiertes Marketing nutzbar macht.
2.000+ Merkmale als Basis für KI-gestütztes Marketing
Ein Finanzdienstleister führt Kunden-, Transaktions- und Interaktionsdaten aus zahlreichen Quellsystemen in einer mehrschichtigen Data-Lakehouse-Architektur auf AltaSigma zusammen. Batch-Daten und laufende Datenströme werden zentral verarbeitet und zu über 2.000 wiederverwendbaren Merkmalen je Kunde aufbereitet – mit klarer Governance und kontrollierten Datenzugriffen.
Diese Datenbasis schafft die Grundlage für AI-gestützte Kundenansprache und Vorhersagen. Modelle greifen direkt auf die aufbereiteten Merkmale zu und lassen sich auf dieser Basis skalieren und weiterentwickeln, ohne die Daten für jeden neuen Use Case erneut zusammenführen zu müssen.
FAQs
Ein Data Lake speichert Daten unterschiedlichster Formate flexibel, während ein Data Warehouse auf strukturierte Daten für Analytics und Reporting ausgerichtet ist. Ein Data Lakehouse verbindet die Offenheit eines Data Lakes mit leistungsfähiger Datenverarbeitung und schafft eine gemeinsame Datenbasis für BI und AI – von der Datenintegration bis zur Nutzung.