# Datensatz zu `Publikationspraktiken für Forschungsdaten in Hochschulschriften: Eine Untersuchung der Veröffentlichungsformate und -methoden`

Dies ist der Datensatz zur Masterarbeit von Dr. David Krassnig für den weiterbildenden Masterstudiengang `Bibliotheks- und Informationswissenschaft im Fernstudium`. Die Arbeit wurde im Rahmen eines Bibliotheksreferendariats an der Universitätsbibliothek Johann Christian Senckenberg (10/2022-09/2024) erstellt.

## Datenmanagementplan

Der Datenmanagementplan zu diesem Datensatz befindet sich im Hauptordner unter `dmp.pdf`.

## Permanent Identifiers

**DOI der dazugehörigen Masterarbeit:** [10.5281/zenodo.11506621](https://doi.org/10.5281/zenodo.11506621)
**DOI dieses Datensatzes:** [10.5281/zenodo.11401021](https://doi.org/10.5281/zenodo.11401021)

## Inhaltliche Beschreibung

Dieser Datensatz enthält:

1. Eine differenzierte Klassifikation von promotionsberechtigten Hochschulen, hinsichtlich ihrer allgemeinen und promotionsspezifischen Richtlinien zu Forschungsdaten oder Forschungsdatenmanagement.
2. Eine differenzierte Klassifikation von Dissertationen aus dem [institutionellen Repositorium der Leibniz Universität Hannover](https://repo.uni-hannover.de/), hinsichtlich der Publikation von originären und primären Forschungsdaten.

## Technische Informationen

- **Grafiken:** Alle Grafiken basieren auf TEX bzw. TIKZ. Die dazugehörigen TEX- und generierten PDF-Dateien sind enthalten. Alle PDF-Dateien entsprechen dem PDF/A-2b Standard.
- **Tabellen:** Alle Tabellen sind als CSV-Dateien enkodiert. Eigene CSV-Dateien verwenden `,` als Trennzeichen und doppelte Anführungszeichen (`""`) als String-Delimiters. Externe CSV-Dateien können abweichen.
- **Skripte:** Python-Skript-Dateien enden auf _.py, Bash-Skript-Dateien auf _.sh.
- **Beschreibende Dateien:** Nutzen entweder das allgemeine Standard-Markdown-Format oder ein JSON-Schema.
- **Archive:** Damit dieser Datensatz modular heruntergeladen werden kann, wurden alle Hauptunterordner in *.tar Dateien archiviert. Auf Windows-Systemen können diese entweder mit 7-Zip (https://www.7-zip.org/) oder mit dem Windows-Subsystem für Linux via `tar -xvf` entpackt werden

## Struktur und Dateien

Eine komplette Übersicht der Dateien und Ordner befindet sich in den folgenden Dateien:

- `inhaltsverzeichnis-ls.txt` (menschenlesbar, Einzelauflistung jedes Ordners)
- `inhaltsverzeichnis-tree.txt` (menschenlesbar, Baumdarstellung)
- `inhaltsverzeichnis-tree.json` (maschinenlesbar, Baumdarstellung, beinhaltet SHA256-Summen für alle Dateien)

### Beschreibung der Struktur

#### Hauptunterordner

- `a_allgemein` (enthält alle übergreifenden Primär- und Sekundärdaten)
- `b_fd-richtlinien` (enthält Daten zu allgemeinen und promotionsspezifischen Forschungsdatenrichtlinien)
- `c_luh-repo` (enthält Daten zu den Dissertationen aus dem Repositorium der Leibniz Universität Hannover)

#### Weitere Unterordner

Jeder dieser Ordner besitzt die folgenden vier Unterordner:

1. `01_tabellen` (enthält tabellarische Daten)
2. `02_grafiken` (enthält Grafiken, die in der Abschlussarbeit genutzt wurden)
3. `03_skripte` (enthält Skripte zur Erstellung/Bearbeitung der Daten)
4. `04_rohdaten` (enthält PDF- und HTML-Dateien zur Erstellung/Bearbeitung der Daten)

Die Unterordner 02-04 haben keine feste Unterstruktur. Für Unterordner 01 wurde folgende Unterstruktur festgelegt:

- `00_datengrundlage` (beinhaltet alle unmodifizierten Grundlagendaten)
- `01_grundmenge` (beinhaltet unmodifizierte Daten zur Stichprobengewinnung)
- `02_stichprobe` (beinhaltet unmodifizierte gezogene Stichproben)
- `03_verarbeitet` (beinhaltet bearbeitete Daten)
- `04_statistik` (beinhaltet statistische Sekundärdaten)

#### Dateibenennung

Die Dateien wurden nach folgendem Schema benannt. Sternchen (\*) kennzeichnen rekursiv wiederholbare Elemente, runde Klammern optionale Elemente:

```
<hauptordner-code>_<datenbasis>(_untergruppierung)*(_verarbeitung)*.<dateiendung>
```

##### Mögliche Datenbasis

- `datengrundlage` (bezieht sich auf eine Datengrundlage)
- `grundmenge` (bezieht sich auf eine Grundmenge)
- `stichprobe` (bezieht sich auf eine Stichprobe)

##### Beispiel

Eine klassifizierte 2012-2015 Fakultät-ARC-Stichprobe aus `c_luh-repo` würde folgendermaßen benannt:

```
luh-repo_stichprobe_metadaten_fakultaet-arc_2012-2015_klassifiziert.csv
```

Diese Struktur und Klarheit sollen den Zugriff und die Nutzung der Daten erleichtern.
