Databricks Unity Catalog: Workday-Daten ohne Kopierpipeline
Personal- und Finanzdaten sind für Unternehmensplanung wichtig, liegen aber häufig getrennt von Vertriebs- und Betriebsdaten. Wer Workday und Azure Databricks nutzt, bekommt jetzt eine zusätzliche Möglichkeit, diese Informationen zusammen auszuwerten: Databricks Unity Catalog erhält einen öffentlich verfügbaren Beta-Konnektor für Workday Data Connect. Er ermöglicht Abfragen ohne eine zusätzliche Datenkopie im Lakehouse. Für den Mittelstand kann das weniger Integrationsaufwand bedeuten – vorausgesetzt, Datenbereitstellung, Berechtigungen und Analysezweck passen zusammen.
Kurz gesagt: Der neue Beta-Konnektor macht freigegebene Personal- und Finanzdaten aus Workday Data Cloud über Unity Catalog abfragbar. Databricks liest dafür Iceberg-Tabellen direkt aus dem von Workday verwalteten Cloud-Speicher und verarbeitet die Abfragen auf eigenen Rechenressourcen. Eine zusätzliche Übernahmepipeline nach Databricks entfällt; Datenschutzprüfung und fachliche Datenaufbereitung bleiben notwendig.
Was ist neu an der Workday-Anbindung im Databricks Unity Catalog?
Neu ist eine native Katalogföderation, die Workdays freigegebene Tabellen in Unity Catalog zugänglich macht, ohne sie zuvor in Databricks zu übernehmen. Der Konnektor befindet sich in der Beta; Workday Data Connect selbst ist bereits allgemein verfügbar.
Technisch übernimmt Unity Catalog die Tabellenmetadaten aus dem Iceberg-REST-Katalog von Workday. Ein sogenannter Foreign Catalog bildet diese externen Tabellen in Databricks ab. Die eigentlichen Daten bleiben im verwalteten Speicher von Workday und werden bei der Abfrage von Databricks gelesen.
Die Verarbeitung findet in Databricks statt
Das unterscheidet die Katalogföderation von einer Abfrageföderation, bei der SQL an ein externes Datenbanksystem geschickt und dort ausgeführt wird. Hier stellt Databricks die Rechenleistung bereit. Die Tabellen lassen sich anschließend beispielsweise mit Databricks SQL, Notebooks oder Genie verwenden.
Der Zugriff ist ausschließlich lesend. Workday bleibt das führende System für die betreffenden Personal- und Finanzdaten. Der Konnektor ist also kein Weg, um aus einer Analyse heraus Stammdaten oder Buchungen in Workday zu ändern.
Für welche Mittelstandsunternehmen lohnt sich der Ansatz?
Der Ansatz lohnt sich vor allem für Unternehmen, die Workday Data Cloud und Databricks bereits einsetzen und aktuelle Workday-Daten gemeinsam mit anderen Unternehmensdaten analysieren möchten, ohne dafür eine zusätzliche dauerhafte Kopie aufzubauen.
Für ein Unternehmen mit Azure Databricks kann das beispielsweise bedeuten: Vertriebsdaten liegen bereits auf der Analyseplattform, während Personalbestand und Finanzdaten über den neuen Katalog hinzukommen. Fachbereiche können diese Informationen gemeinsam auswerten, statt regelmäßig separate Exporte zusammenzuführen.
Mögliche Anwendungsfälle sind:
- Kapazitätsplanung: Personalbestand je Organisationseinheit mit Auftragsbestand und Produktionsplanung vergleichen.
- Finanzsteuerung: Finanzdaten aus Workday mit Umsatzprognosen oder operativen Kennzahlen zusammenführen.
- Personalcontrolling: Aggregierte Entwicklungen nach Standort oder Kostenstelle untersuchen, sofern Berechtigungen und Datenschutzkonzept das erlauben.
- Fachliche Abfragen mit Genie: Fragen in natürlicher Sprache auf freigegebenen Daten ermöglichen, ohne jedem Nutzer direkten Zugriff auf alle Tabellen zu geben.
Die Verbindung allein liefert allerdings noch keine belastbaren Kennzahlen. Kostenstellen, Geschäftsjahre und Organisationsstrukturen müssen fachlich zusammenpassen. Eine durchdachte Datenplattform braucht deshalb neben Konnektoren auch gemeinsame Definitionen und klare Datenverantwortung.
Was bedeutet „ohne Datenkopien“ tatsächlich?
„Ohne Datenkopien“ bedeutet hier, dass für den föderierten Zugriff keine zusätzliche persistente Kopie der freigegebenen Workday-Tabellen in Databricks erforderlich ist. Es bedeutet nicht, dass keine Daten übertragen oder außerhalb von Workday verarbeitet werden.
Databricks muss die benötigten Daten lesen, um eine Abfrage auszuführen. Wer Ergebnisse anschließend als Tabelle, Export oder Eingabe für weitere Anwendungen speichert, erzeugt damit gegebenenfalls neue Datenbestände. Diese gehören ebenfalls in das Berechtigungs- und Löschkonzept.
Auch „aktuell“ ist nicht automatisch gleichbedeutend mit „Echtzeit“. Die Daten sind bereits in Workday Data Cloud bereitgestellt. Ihre nutzbare Aktualität hängt deshalb unter anderem davon ab, wann sie dort verfügbar werden. Für zeitkritische Planung solltest du diese Aktualität ausdrücklich prüfen.
Föderation ersetzt nicht jede Datenübernahme
Für historische Berichte oder reproduzierbare Monatsabschlüsse kann eine kontrollierte Datenkopie weiterhin sinnvoll sein. Databricks bietet dafür ergänzende Zugriffswege:
- Lakeflow Connect: Übernimmt Workday-Daten inkrementell in Delta-Tabellen und eignet sich für dauerhafte Bestände und Historisierung.
- Workday Data Connect Federation: Erschließt den externen Katalog für lesende Analysen ohne zusätzliche Übernahmepipeline.
- Live Data Query über JDBC: Ermöglicht bedarfsweise Abfragen, übernimmt jedoch nicht die zugrunde liegenden Tabellenmetadaten in Unity Catalog.
Die Architekturentscheidung lautet daher nicht pauschal „kopieren oder nicht kopieren“, sondern: Welcher Zugriff erfüllt den jeweiligen fachlichen Zweck?
Welche Kontrollen sind bei Personal- und Finanzdaten nötig?
Notwendig sind klar begrenzte Zugriffsrechte, nachvollziehbare Nutzung und eine Prüfung der Verarbeitung personenbezogener Daten; die technische Anbindung allein stellt keine DSGVO-Konformität her.
Unity Catalog unterstützt für die föderierten Daten Berechtigungen auf Katalog-, Schema- und Tabellenebene sowie Datenherkunftsnachweise und Auditierung. Damit kannst du die Workday-Anbindung in die bestehenden Governance-Strukturen deiner Databricks-Plattform einordnen.
Für deutsche Unternehmen bleiben dennoch konkrete Fragen:
- Datenumfang: Welche Tabellen und Attribute sind für den Analysezweck tatsächlich erforderlich?
- Zugriff: Wer darf personenbezogene Details sehen, wer benötigt nur aggregierte Kennzahlen?
- Verarbeitungsort: Welche Speicher- und Compute-Regionen sowie Übertragungswege werden genutzt?
- Verantwortung: Wer genehmigt Freigaben, kontrolliert Berechtigungen und behandelt Exporte?
- Mitbestimmung: Ist bei geplanten Personalauswertungen der Betriebsrat einzubeziehen?
Gerade Genie sollte nur auf fachlich vorbereitete und passend freigegebene Daten zugreifen. Eine natürlichsprachliche Oberfläche ersetzt weder ein Berechtigungskonzept noch die Prüfung, ob eine Kennzahl korrekt interpretiert wird.
So bereitest du einen Pilot auf Azure Databricks vor
Ein sinnvoller Pilot beginnt mit einer begrenzten Fragestellung und wenigen freigegebenen Tabellen. So kannst du Nutzen und technische Grenzen prüfen, bevor die Anbindung breiter verwendet wird.
Voraussetzungen gemeinsam klären
Auf Workday-Seite muss Data Connect für den Mandanten aktiviert sein. Außerdem werden Tabellenfreigaben, ein API-Client mit JWT-Bearer-Verfahren und ein Integration System User mit passenden Leserechten benötigt.
Auf Databricks-Seite nennt die Ankündigung einen Workspace mit aktiviertem Unity Catalog und Compute mit Databricks Runtime 19 oder höher. Ein Workspace-Administrator muss den Beta-Konnektor über die Vorschaufunktionen aktivieren. Anschließend werden eine OAuth-Verbindung und der Foreign Catalog eingerichtet.
Vor dem Pilot solltest du zusätzlich die konkrete Verfügbarkeit für deine Azure-Umgebung sowie Beta-Einschränkungen und Nutzungsbedingungen bestätigen lassen.
Fachlichen Nutzen und Betriebsfähigkeit testen
Prüfe anhand repräsentativer Abfragen Datenaktualität, Laufzeiten, entstehende Kosten und das Verhalten bei fehlenden Berechtigungen oder Verbindungsproblemen. Kläre außerdem, ob du historische Stände benötigst. Erst danach lässt sich entscheiden, welche Auswertungen föderiert bleiben und welche eine kontrollierte Datenübernahme brauchen.
Was das für dich bedeutet
Der neue Konnektor kann Workday-Daten leichter für gemeinsame Analysen in Azure Databricks zugänglich machen. Sein größter Nutzen liegt im Wegfall einer zusätzlichen Kopierpipeline – nicht im Wegfall von Datenmodellierung, Datenschutz oder Betriebsverantwortung. Wegen des Beta-Status ist ein klar abgegrenzter Pilot der passende Einstieg.
Du möchtest prüfen, ob Föderation zu deiner Plattform passt? Mit unserer Databricks-Beratung unterstützt Ailio dich bei Architektur, Governance und der Planung eines passenden Piloten.
Redaktionelle Einordnung auf Basis eines Beitrags im Databricks-Blog.
