Published April 22, 2025 | Version v2.0.0

Das Public Use File des Forschungsdatenzentrum Gesundheit

  • 1. Forschungsdatenzentrum Gesundheit
  • 2. ROR icon Koblenz University of Applied Sciences

Description

------ See English version below ------

Das Forschungsdatenzentrum Gesundheit

Das Forschungsdatenzentrum (FDZ) Gesundheit hat sich zum Ziel gesetzt, die medizinische Versorgung in Deutschland und der EU zu verbessern. Dies geschieht durch neue Forschung, die durch den Zugang zu Krankenversicherungsdaten ermöglicht wird. Die Datennutzung wird jedoch von strengen Datenschutzbestimmungen eingeschränkt. Folgende Schritte sind für die Datennutzung notwendig:

  • Forschende können den Zugang zu Gesundheitsdaten gemäß §303e SGB V beantragen.
  • Nach Genehmigung erhalten Forschende Zugriff auf eine sichere Verarbeitungsumgebungen im Sinne des Europäischen Gesundheitsdatenraums (EHDS).
  • In diesen Umgebungen werden anonymisierte, synthetische oder pseudonymisierte Daten für die Entwicklung von Algorithmen verwendet. Die endgültigen Analysen werden unter strenger Aufsicht auf dem gesamten Originaldatensatz durchgeführt, um den Datenschutz zu gewährleisten. Für weitere Informationen zum FDZ Gesundheit können Sie unsere Website besuchen.

Das Public Use File

Um den Herausforderungen des zeitaufwändigen Antragsverfahrens zu begegnen und den Forschenden die Möglichkeit zu geben, sich mit der Datenstruktur vertraut zu machen, hat das FDZ ein Public Use File (PUF) entwickelt. Das PUF ist ein anonymisierter Datensatz, der aus den Originaldaten der Krankenkassen abgeleitet wurde. Er behält die univariaten Verteilungen der Originaldaten bei, entfernt aber die Korrelationen zwischen den Variablen, um den Datenschutz zu gewährleisten. Der Datensatz enthält realistische Fehler aus den Originaldaten, was seinen Nutzen für vorläufige Analysen, Softwareentwicklung und Testskripte erhöht.

Das PUF ist ein öffentliches Datenprodukt des Forschungsdatenzentrum Gesundheit. Um die Publikation des Datenprodukts zu ermöglichen, muss der Datensatz anonym sein. Um Anonymität zu erreichen, haben wir folgende Methoden angewandt:

  • Auflösung aller Korrelationen zwischen Variablen
  • Vergröberung von Variablen, bei denen ein Wert nicht mindesten k-mal vorkommt
  • Ersetzung der Pseudonyme durch zufällige (aber theoretisch gültige) Werte
  • Veröffentlichung einer Stichprobe (1%) 
  • Veröffentlichung nur eines Berichtsjahres pro Datenmodell

Der vollständige Code zur Erstellung des Public Use Files ist ebenfalls öffentlich einsehbar in diesem GitHub repository. 

Die Daten sind in drei Datenmodellen verfügbar. Eine genaue Beschreibung der Datenmodelle und dem Inhalt der einzelnen Variablen ist in unserer Datensatzbeschreibung einsehbar. Wir stellen pro Datenmodell eine ZIP-Datei bereit, welche alle Tabellen dieses Datenmodells enthält. Zusätzlich ist in jeder Tabelle eine Spalte "Datenmodell" enthalten, welche die Zugehörigkeit zum Datenmodell eindeutig kennzeichnet.

Hinweise

Einlesen der Dateien

Beim Einlesen der Dateien bitte auf die in der Datensatzbeschreibung angegebenen Datentypen achten und explizit angeben, andernfalls werden zum Beispiel führende Nullen abgeschnitten. 

Beispiel (Python):

import pandas as pd

df_sa451 = pd.read_csv('DM1/SA451.csv', dtype={'SA451_VSID': str, 'SA451_PHARMAZENTRALNUMMER': str})

VSID und PSID

Die Identifier-Variablen VSID und PSID sind nicht im gleichen Verhältnis wie in den Orginaldaten vorhanden. Es gibt deutlich mehr PSIDs die mehr als eine VSID zugeordnet hat. In den Echtdaten ist dies ein Hinweis auf einen Krankenkassenwechsel.

Versionierung

v1.0.0

  • initialer Release 

v1.1.0

  • Hinzufügen der Satzart SA131 für Datenmodell 2
  • Hinzufügen von doppelten PSIDs für Datenmodell 2

v2.0.0

  • Hinzufügen vom Public Use File für Datenmodell 3 
  • Formatänderung der PSID für alle Datenmodelle 
  • Ändern der VSID für Datenmodell 2 (war vorher identisch mit Datenmodell 1) 

Kontakt

Bei Fragen oder Anregungen wenden Sie sich gerne an fdz@bfarm.de.

 

----------------------------------------------

English version

 

The Health Data Lab's Public Use File 

The Health Data Lab

The Health Data Lab (Forschungsdatenzentrum Gesundheit, FDZ Gesundheit) aims to improve care in Germany and the EU. This is achieved through new research enabled by access to health insurance claims data. However, data use is restricted by strict data protection regulations. The following steps are required for data use: 

  • Researchers can apply for access to health data in accordance with §303e SGB V.
  • After approval, researchers gain access to secure processing environments as defined by the European Health Data Space (EHDS).
  • In these environments, anonymized, synthetic, or pseudonymized data are used for algorithm development. Final analyses are conducted under strict supervision on the complete original dataset to ensure data protection. 

For more information about the Health Data Lab, please visit our website

The Public Use File 

To address the challenges of the time-consuming application process and to give researchers the opportunity to familiarize themselves with the data structure, the Health Data Lab has developed a Public Use File (PUF). The PUF is an anonymized dataset derived from the original health insurance claims data. It preserves the univariate distributions of the original data bur removes correlations between variables to ensure data protection. The dataset contains realistic errors from the original data, which increases its usefulness for preliminary analyses, software development, and testing scripts. 

The PUF is a public data product of the Health Data Lab. To enable publication of the data product, the dataset must be anonymous. To achieve anonymity, we applied the following mehthods:

  • Dissolution of all correlations between variables
  • Coarsening of variables where a value does not occur at least k times 
  • Replacement of pseudonyms with random (but theoretically valid) values
  • Publication of a sample (1%)
  • Publication of only one reporting year per data model 

The complete code for creating the Public Use File is also publicly available in this GitHub repository. 

The data are available in three data models. A detailed description of the data models and the content of each variable can be found in our dataset description. We provide one ZIP file per data model, which contains all tables of that data model. Additionally, each table contains a column "Datenmodell" (data model) that uniquely identifies the data model affiliation. 

Notes 

Reading the files 

When reading the files, please pay attention to the data types specified in the dataset description and specify them explicitly; otherwise leading zeros will be truncated, for example. 

Example (Python):

import pandas as pd

df_sa451 = pd.read_csv('DM1/SA451.csv', dtype={'SA451_VSID': str, 'SA451_PHARMAZENTRALNUMMER': str})

VSID and PSID 

The identifier variables VSID and PSID are not present in the same ratio as in the original data. There are significantly more PSIDs that have more than one VSID assigned. In the real data, this is an indication of a health insurance change. 

Versioning

v1.0.0

  • Initial release 

v1.1.0

  • Addition of record type SA131 for data model 2
  • Addition of duplicate PSIDs for data model 2

v2.0.0

  • Addition of the Public Use File for data model 3 
  • Format change of the PSID for all data models 
  • Change of the VSID for data model 2 (was previously identical to data model 1) 

Contact

For questions and suggestions, please contact: fdz@bfarm.de.

Files

PUF_DM1.zip

Files (11.0 GB)

Name Size
md5:bc58f60e6e6939d00e1c30adc5e51acc
1.4 GB Preview Download
md5:0cdb3751d2f1558813fc05a691b14131
1.8 GB Preview Download
md5:09e6158e845470cd8ce4c74b1cd8e45d
7.8 GB Preview Download

Additional details

Additional titles

Translated title
The Health Data Lab's Public Use File

Related works

Has metadata
Dataset: 10.5281/zenodo.11056800 (DOI)

Software

Repository URL
https://github.com/FDZ-Gesundheit/Public-Use-File
Programming language
Python
Development Status
Active