← Zurück zu Über das Projekt

Technische Details zu den Aufnahmen

Seit 2019 hat sich die Technologie hinter Thorsten-Voice stetig weiterentwickelt – von Coqui TTS über Piper TTS bis hin zu den aktuellen CosyVoice-Modellen. Jede Generation brachte natürlichere Betonung, mehr Emotionalität und neue Dialektvarianten. Grundlage dafür sind über 30.000 Aufnahmen, die ich im Verlauf der Jahre selbst eingesprochen habe.

Lizenz & Verfügbarkeit

Alle Aufnahmen stehen unter der CC0-Lizenz frei auf Zenodo und Hugging Face zur Verfügung. Durch die freigebige Lizenz eignen sie sich auch für Wissenschaft und Forschung.

Die einzelnen Datasets

Thorsten-Voice Dataset 2021.02 (Neutral)

Anzahl Aufnahmen
22.668
Audiodauer
23+ Stunden
Samplerate
22.050Hz
Kanäle
Mono
Normalisierung
-24dB
Satzlänge (min/avg/max)
2 / 52 / 180 Zeichen
Sprechgeschwindigkeit (Ø)
14 Zeichen/Sekunde
Fragesätze
2.780
Ausrufesätze
1.840
Zitation (BibTeX)
@dataset{muller_thorsten_2021_5525342,
  author    = {Müller, Thorsten and Kreutz, Dominik},
  title     = {Thorsten - Open German Voice (Neutral) Dataset},
  month     = feb,
  year      = 2021,
  publisher = {Zenodo},
  version   = {3.0},
  doi       = {10.5281/zenodo.5525342},
  url       = {https://doi.org/10.5281/zenodo.5525342}
}

Thorsten-Voice Dataset 2021.06 (Emotional)

300 unterschiedliche Sätze, jeweils gesprochen in acht Emotionen: Neutral, Angewidert, Wütend, Amüsiert, Überrascht, Schläfrig, Flüsternd und Betrunken (nur schauspielerisch betont – ich war während der Aufnahmen nüchtern).

Anzahl Aufnahmen
2.400
Kanäle
Mono
Normalisierung
-24dB
Satzlänge (min/max)
59 / 148 Zeichen
Zitation (BibTeX)
@dataset{muller_thorsten_2021_5525023,
  author    = {Müller, Thorsten and Kreutz, Dominik},
  title     = {Thorsten - Open German Voice (Emotional) Dataset},
  month     = jun,
  year      = 2021,
  publisher = {Zenodo},
  version   = {2.0},
  doi       = {10.5281/zenodo.5525023},
  url       = {https://doi.org/10.5281/zenodo.5525023}
}

Thorsten-Voice Dataset 2022.10 (Neutral)

Anzahl Aufnahmen
12.432
Audiodauer
11 Stunden
Samplerate
22.050Hz
Kanäle
Mono
Normalisierung
-24dB
Sprechgeschwindigkeit (Ø)
17,5 Zeichen/Sekunde
Zitation (BibTeX)
@dataset{muller_thorsten_2022_7265581,
  author    = {Müller, Thorsten and Kreutz, Dominik},
  title     = {ThorstenVoice Dataset 2022.10},
  month     = oct,
  year      = 2022,
  publisher = {Zenodo},
  version   = {1.0},
  doi       = {10.5281/zenodo.7265581},
  url       = {https://doi.org/10.5281/zenodo.7265581}
}

Thorsten-Voice Dataset 2023.09 (Hessisch)

Anzahl Aufnahmen
2.108
Audiodauer
ca. 2 Stunden
Samplerate
22.050Hz
Kanäle
Mono
Normalisierung
-24dB
Zitation (BibTeX)
@dataset{muller_2024_10511260,
  author    = {Müller, Thorsten and Kreutz, Dominik},
  title     = {Thorsten-Voice Dataset 2023.09 Hessisch},
  month     = jan,
  year      = 2024,
  publisher = {Zenodo},
  doi       = {10.5281/zenodo.10511260},
  url       = {https://doi.org/10.5281/zenodo.10511260}
}

Thorsten-Voice Dataset (TV-44kHz-Full)

Alle Aufnahmen in einem Dataset, in der originalen Samplerate von 44kHz, logisch in Subsets aufgeteilt und mit Metadaten zu Dauer, Sprechgeschwindigkeit, Aufnahmemonat und Qualität versehen.

Zitation (BibTeX)
@misc{thorsten_mueller_2024,
  author    = {Thorsten Müller},
  title     = {TV-44kHz-Full (Revision ff427ec)},
  year      = 2024,
  url       = {https://huggingface.co/datasets/Thorsten-Voice/TV-44kHz-Full},
  doi       = {10.57967/hf/3290},
  publisher = {Hugging Face}
}

Thorsten-Voice Dataset 2025.12 (Mini FineTuning)

Mit lediglich 60 Aufnahmen deutlich kompakter als die übrigen Datasets. Gedacht zum Finetuning bestehender Thorsten-Voice-TTS-Modelle.

Anzahl Aufnahmen
60
Samplerate
24kHz
Normalisierung
-24dB

Thorsten-Voice auf YouTube

Als Enthusiast für freie Sprachtechnologien betreibe ich seit einigen Jahren den „Thorsten-Voice" Kanal auf YouTube. Hier veröffentliche ich regelmäßig Schritt-für-Schritt-Anleitungen zu Open-Source-Sprachtechnologien, News aus dem Bereich sowie gelegentlich Interviews mit faszinierenden Persönlichkeiten aus dem Bereich der freien Sprachausgabe.

Thorsten-Voice @ YouTube