Inhaltsverzeichnis

Alle Kapitel aufklappen
Alle Kapitel zuklappen
Einleitung
9
1 Die Grundlagen der Audio-KI
15
1.1 Machine Learning und Deep Learning: Die Konzepte
15
Das biologische Vorbild: Wie menschliche Neuronen funktionieren
16
Das künstliche Gegenstück: Wie Machine Learning funktioniert
17
Die Revolution: Deep Learning und künstliche neuronale Netze
18
Der fundamentale Unterschied: Warum KI (noch) nicht wie Menschen musiziert
20
Das Trainieren künstlicher Gehirne: Backpropagation und Gradientenabstieg
21
1.2 Spezifische Algorithmen und Methoden für Audio
23
Das Spektrogramm: Wenn Töne zu Bildern werden
23
VAEs: Die Kunst der Kompression
25
Transformer: Der große Zusammenhang
26
1.3 Grundlagen der Diffusionsmodelle und ihre Funktionsweise im Audiobereich
27
Latent Diffusion: Der Turbo
28
Autoregressive Token-Modelle
28
Von Text zu Musik
29
Wie KI Audio verarbeiten, analysieren und generieren kann
29
Herausforderungen und Einschränkungen der Diffusionsmodelle
31
1.4 Vom Konzept zur Umsetzung: Wie plant man ein KI-Audio-Projekt?
33
2 KI in der Musikproduktion
35
2.1 KI-Tools für die Musikgenerierung am Beispiel von Suno
35
2.2 Einführung in Suno
36
Songkreation
38
Nachbearbeitung
39
Oberfläche
40
Bewertung
42
Zukünftige Entwicklungen
43
Eigene Audios bei Suno hochladen
44
2.3 Alternativen zu Suno: Lyria, Udio und AIVA
47
Udio
47
Lyria
48
AIVA
49
Google Flow Music (ehemals Producer AI) als Spielwiese für Kreative
49
2.4 Prompting
52
Allgemeine Promptregeln
52
Promptbeispiele
55
Suno-Promptgenerator
58
2.5 Mit Rollenanweisungen kreativ werden
60
Ein rechtliches Minenfeld
67
2.6 Der Audio-Workflow mit KI: Von der ersten Idee zum fertigen Master
68
Ideenfindung
69
Lyrics
70
Musikgenerierung
71
Stimmen
73
Stem Separation
74
Editing
75
Mixing
76
Mastering
78
Effekte
80
Fazit: Vom Werkzeugkasten zum eigenen Handwerk
82
2.7 Musik analysieren und beschreiben in Komposition und Arrangement
82
2.8 Musikinstrumente und -effekte: Neue Klangwelten erzeugen
85
KI-basierte Musikempfehlung und -personalisierung
87
2.9 Audio-Branding, Jingles und Geräusche prompten
88
Promptbeispiele
89
Was gehört zum Audio-Branding?
93
3 Audio in der KI-gestützten Medienproduktion
95
3.1 Was verändert sich im Audio-Workflow?
96
3.2 Spracherkennung und -transkription von Videos
98
Tools im Einsatz
98
Der Workflow
100
3.3 Übersetzung: Barrieren überwinden mit KI
103
Tools
104
Welches Werkzeug setze ich wann ein? Welchem Entscheidungsprinzip folge ich?
105
Kopfhörer, die in Echtzeit übersetzen?
107
Wohin geht die Entwicklung?
108
3.4 KI-Chatbots und virtuelle Assistenten in ­Audioumgebungen
109
3.5 Musik und Video: Wenn aus Musik Bilder und Videos werden und umgekehrt
111
Musikvideos mit KI erstellen
112
Wie geht es weiter?
113
4 Synthetische Stimmen
115
4.1 Entwicklung synthetischer Stimmen: Ein bisschen Geschichte
115
Die mechanischen Orakel: Wie das 18. Jahrhundert der Sprache eine Form gab
116
Die elektrische Stimme: Bell Labs und die Geburt der elektronischen Sprache
118
Der digitale Geist in der Maschine: Als Computer singen lernten
119
Die Stimme der 80er: Synthese für alle und die Geburt einer Identität
120
Die Bibliothek der Stimmen: Der Aufstieg der datengesteuerten Sprache
123
Die neuronale Renaissance: Als Maschinen lernten, mit eigener Stimme zu sprechen
124
Fazit: Vom mechanischen Flüstern zum digitalen Echo
126
4.2 Die Technologie hinter synthetischen Stimmen
126
Die Anatomie einer KI-Stimme
127
Herausforderungen: Wo die KI noch ins Straucheln gerät
128
Ein Beispiel: Falcos Stimme – wie ein Dialekt die KI an ihre Grenze brachte
129
4.3 Die wichtigsten Tools im Überblick
130
4.4 Anwendungen synthetischer Stimmen
131
Die neue Hörbuch-Revolution: Geschichten für alle zugänglich machen
132
Die sich wandelnde Podcast-Landschaft: Von der Automatisierung zur Globalisierung
134
Unternehmens- und Bildungsnarration: Die Stimme der Effizienz
136
Interaktive Welten: Stimmen, die zuhören und reagieren
138
Stimmen für die Menschheit: Assistive und restaurative Anwendungen
140
4.5 Die Konsequenzen für Sprecher und Ton­studios: Herausforderungen und Chancen
144
Synchronsprecher unter existenziellem Druck
145
SAG-AFTRA: Der Versuch, Regeln aufzustellen
145
Einwilligung als Währung der Legitimität
146
Fazit: Eine Welt voller Stimmen
147
4.6 Die Rolle von KI-gestützten Sprecher-Tools: Optimierung und Personalisierung
149
Der digitale Maskenbildner: Voice-to-Voice-Transformation
150
Der KI-Lektor: Bearbeitung auf Textebene
150
Die Lokalisierungsmaschine: Automatische Synchronisation
153
Hyper-Personalisierung: One-to-Many wird zu One-to-One
156
4.7 Die Bedeutung von Authentizität und Originalität in der Sprechkunst
160
Das Paradox der Perfektion
161
Ist da eine Seele in der Datenwolke?
163
Das Vertrauensdilemma
164
Der Wert des Originals
164
Die neue Rolle der Sprecher: Vom Leser zum Interpreten
166
Die Tendenz zur Mitte
167
Authentizität als Praxis, nicht als Eigenschaft
168
Die Zukunft: Hybride Praktiken und neue Ästhetiken
169
5 Wie KI Klang analysiert, versteht und verbessert
171
5.1 KI-gestützte Audioanalyse für die Erkennung von Geräuschen, Tönen und Emotionen
171
Das wachsende Ohr der Industrie: Vorausschauende Wartung durch Klang
173
Die Stimme als Spiegel der Seele: Emotionserkennung in der Praxis
175
Die Stimme als Biomarker: KI in der medizinischen Diagnostik
177
Weitere Anwendungsfelder: Von Artenschutz bis Sicherheit
178
5.2 KI in der Psychoakustik: Das menschliche Gehör in der Simulation
181
Wie wir räumlich hören: Ein Wunderwerk der Evolution
181
Die HRTF: Ihr persönlicher akustischer Fingerabdruck
182
KI macht räumlichen Klang persönlich
183
3D-Audio-Technologien: Dolby Atmos und Co.
184
Binaurales Audio
185
Head-Tracking: Wenn der Klang Ihrem Kopf folgt
187
KI in Hörgeräten: Wenn Technologie Leben verändert
188
5.3 KI-gestützte Restauration und Verbesserung von Audioaufnahmen
190
iZotope RX
192
Adobe Enhanced Speech
193
Krisp.ai: Ruhe mitten im Lärm
196
Cleanvoice: Der Perfektionist für Podcasts
196
Auphonic: Die automatische Tonregie
196
Es gibt Grenzen …
197
Empfehlungen für die Praxis
198
6 Ethische und gesellschaft­liche Implikationen
199
6.1 Die Auswirkungen der KI auf die Arbeitswelt im Audiobereich
199
Vermessung einer Disruption
200
SAG-AFTRA: Der Kampf um digitale Rechte
201
Konkrete Ersetzungsfälle: Vom Experiment zur Routine
203
Neue Berufsfelder: Die andere Seite der Medaille
204
Zwischen Panik und Pragmatismus: Eine differenzierte Bilanz
205
6.2 Ethische und rechtliche Fragen zu KI-generierter Musik und Sprache
206
Die Urheberrechtsfrage: Input, Throughput, Output
207
Die großen Klagen: Musikindustrie gegen Silicon Valley
210
Stimme als Persönlichkeitsrecht: Die Eigentumsgrenze des Selbst
211
Deepfakes und die Erosion der Authentizität
213
Die Fair-Use-Debatte: Innovation oder Ausbeutung?
213
Das Drei-C-Prinzip
215
Die Frage der Urheberschaft
216
Das Risiko der kulturellen Homogenisierung
217
Internationale Perspektiven: Ein Flickenteppich der Regulation
218
Fazit: Zwischen Innovation und Schutz
219
6.3 Die Bedeutung des AI Act für die ­KI-Entwicklung in der Europäischen Union
221
Das Grundprinzip: Je höher das Risiko, desto strenger die Regeln
221
Der Zeitplan: Wann gilt was?
222
Kennzeichnungspflicht: Wann muss »KI« draufstehen?
223
Was es zu beachten gilt
227
Gema vs. Suno
229
Europa als Vorreiter – oder Bremser?
230
Aktuelle Entwicklungen
231
7 Die Zukunft der KI im Audiobereich
233
7.1 Die treibenden Kräfte der nächsten Audio­generation
233
Schlanker statt größer: Ein Architekturwandel
235
Bild und Ton zusammen: Wenn die KI mit mehreren Sinnen »denkt«
237
Neue Arten der Steuerung: Weg vom Tippen, hin zum Intuitiven
240
Intelligenz im Gerät: KI verlässt die Cloud
243
7.2 Gaming und Virtual Reality: Wo alles zusammenkommt
246
Das Ende des Endlosloops
246
Wenn NPCs wirklich zuhören
246
Audio schlägt Grafik
247
Die neue Rolle der Kreativen
247
7.3 Was das alles bedeutet: Eine neue Art des Hörens
248
Die KI als akustische Membran
249
Eine alte Geschichte, ein neues Kapitel
249
Die Architektur des Hörens wird nicht von Technologen allein gebaut
250
7.4 Wie KI Musik, Sprache und die Audio­produktion verändert
251
Vom Konsum zur Interaktion: Audio wird dynamisch
251
Audio als adaptive Umgebung: Hörwelten statt Playlists
253
Der biometrische Dirigent: Wenn Ihr Zustand die Musik steuert
253
7.5 Jenseits der Sprache: Die neuen Schnittstellen zur Kreativität
254
Biosynchrone Komposition: Der Körper als Instrument
255
Vom Dirigenten zum Komponisten: Gesten und räumliche Steuerung
255
Vom Gedanken zum Klang: Brain-Computer Music Interfaces
255
7.6 Science-Fiction als Blaupause
258
7.7 Die Symphonie des Seins: Eine neue Definition von Audio
259
7.8 Die Rolle von AI Assistants im Audiobereich
260
Die Psychologie der KI-Beziehung: Anthropomorphismus und der ELIZA-Effekt im 21. Jahrhundert
261
Fallstudie »Her«: Eine Analyse der Liebe im Zeitalter der Singularität
263
Am Horizont: Künstliche Allgemeine Intelligenz (AGI) und ihre Konsequenzen
264
Die neue Intimität: Menschliche Beziehungen in einer Welt nach »Her«
269
8 Die Symbiose von Mensch und KI im Audiobereich
271
8.1 Die Balance zwischen Innovation und Verantwortung
271
Die Innovationsdynamik verstehen
272
Die Verantwortungsdimension
273
Fall 1: BandLab – Kreativität stärken, nicht ersetzen
274
Fall 2: NRK – Transparenz als journalistische Haltung
275
Was beide Fälle verbindet
276
Die Zukunft gestalten
277
8.2 Die Rolle der Kreativität in einer KI-geprägten Welt
278
Zwischen Angst und Aufbruch: Wie Künstler und Künstlerinnen auf KI reagieren
279
Vom Machen zum Gestalten
284
8.3 Ein Ausblick in die Zukunft der Musik und des Klangs
286
Die große philosophische Frage: Kann eine Maschine wirklich kreativ sein?
286
Warum Musik die Seele berührt: Neurowissenschaft und das Mysterium des Klangs
288
Die Demokratisierung des musikalischen Ausdrucks
291
Die Seele in der Kunst: Was keine Maschine erschaffen kann
291
Kosmische Musik: Die Voyager-Vision und interstellare Kommunikation
292
Posthumane Horizonte: Die Erweiterung des musikalischen Bewusstseins
294
Die Würde des menschlichen Ausdrucks
295
8.4 Empfehlungen für Forschung, Entwicklung und Politik
297
Was die Wissenschaft leisten muss
297
Was die Industrie verantworten muss
299
Was die Politik entscheiden muss
300
Nachwort
303
Index
311