Signalkette
- TextWort in einer von 108 Sprachen
- SyntheseReferenzstimme: neuronal (Kokoro, Piper) oder Formant (eSpeak)
- SignalKlang wird hörbar und gemessen
- SpektrumFFT, Fenster 46 ms, Schritt 12 ms
- Eigenmodestärkste Spitze → nächste Mode
- AbdruckKörner auf den Knotenlinien
In jedem Zeitfenster bestimmt die stärkste Spektralspitze die Anregungsfrequenz. Eine Membran, die mit langsam wechselnder Frequenz angeregt wird, zeigt jeweils die nächste Eigenmode. Folgen mehrere Fenster derselben Mode, bilden sie einen Abschnitt. Der Abdruck überlagert die Knotenfiguren aller Abschnitte; jeder erhält so viele Körner, wie lange das Wort ihn gehalten hat. Auch die Fehler der Maschinenstimme, ihre falschen Betonungen und fremden Laute, werden so zur Form.
Berechnetes Modell · keine Messung einer bestimmten Platte
Reflexion
Zwei Stimmen, beide eingebaut
Für die Landessprachen der Schweiz und die UNO-Sprachen sprechen natürliche, neuronale Referenzstimmen (Kokoro und Piper), Frau und Mann; für alle übrigen Sprachen spricht die regelbasierte Formantsynthese eSpeak. Beide laufen offline im Browser, sind Teil der Seite und klingen deshalb auf jedem Gerät gleich. Der hörbare Unterschied zwischen Mensch-ähnlicher und Maschinenstimme ist Teil der Arbeit.
Ungleiche Sprachen
Die Synthese kennt 108 Sprachen, aber nicht alle gleich gut. Sprachen mit wenigen digitalen Ressourcen klingen fremder und fehlerhafter. Auch diese Ungleichheit der Sprachtechnik wird im Abdruck sichtbar.
Übersetzung statt Messung
Der Abdruck ist kein Beweis und kein Klangporträt einer Sprache. Er ist eine gestaltete Übersetzung mit offenen Regeln: Fenstergrösse, Membranmodell und Zuordnung zur Eigenmode sind Entscheidungen und hier offengelegt.
Werkzeuge
JavaScript, Web Audio und Canvas, Kokoro, Piper und ONNX Runtime Web, eSpeak NG als WebAssembly, SciPy zur Kontrolle der Besselnullstellen. Beim Programmieren haben KI-Werkzeuge geholfen; Konzept, Gestaltung und Prüfung der Ergebnisse sind eigene Arbeit.
Hintergrund
1787 · Ernst Florens Friedrich Chladni
streut Sand auf Metallplatten und streicht sie mit dem Geigenbogen an. Der Sand verlässt die schwingenden Flächen und bleibt auf den ruhigen Linien liegen. Seine «Entdeckungen über die Theorie des Klanges» machen Schwingung zum ersten Mal sichtbar.
1939 · Voder, Bell Labs
Homer Dudleys Voder spricht an der Weltausstellung in New York: die erste elektronische Stimme, von Hand an einer Tastatur gespielt. Die Maschinenstimme dieser Studie stammt aus derselben Linie der Formantsynthese.
1967 · Hans Jenny, Basel und Dornach
Der in Basel geborene Arzt und Forscher nennt die Sichtbarmachung von Schwingungen «Kymatik» und dokumentiert sie in Fotografien und Filmen. Die Studie knüpft an diese Basler Linie an.
2026 · Resonance Print
überträgt das Prinzip in einen digitalen Raum: nicht ein Ton, sondern ein gesprochenes Wort regt die Membran an. Über 100 Sprachen und drei Stimmen stehen zur Wahl. Sprache wird zur Form, und Sprachen werden vergleichbar, ohne dass man sie verstehen muss.
Methode und Quellen
Physikalisch gesichert: Schwingende Platten und Membranen bilden stehende Wellen; feine Körner werden aus bewegten Bereichen geworfen und sammeln sich auf Knotenlinien. Die Figur hängt von Rand, Geometrie, Material und Anregungsfrequenz ab.
Was diese Seite berechnet: eine ideale Kreismembran mit festem Rand. Eine Mode ist Jm(αmn r) cos(mθ); αmn ist eine Nullstelle der Besselfunktion Jm, die Frequenz skaliert mit fmn = f₀ · αmn / α01. Alle 236 Moden bis 2000 Hz werden beim Laden berechnet. Der Grundton von 110 Hz ist eine gewählte Bezugsgrösse. Eine echte Chladni-Platte hat je nach Grösse, Dicke, Material und Halterung andere Frequenzen; die Seite sagt sie nicht voraus.
Sprachsynthese: Natürliche Referenzstimmen mit Kokoro (Englisch, Französisch, Italienisch, Spanisch, Portugiesisch, Chinesisch; Deutsch Frau mit leichtem Akzent, weil Kokoro kein eigenes Deutsch hat) und Piper (Deutsch Mann, Russisch, Ukrainisch, Arabisch), neuronale Modelle in ONNX Runtime Web, mit den Einstellungen der jeweiligen Stimme gerechnet, damit sie natürlich klingt. Für alle anderen Sprachen eSpeak NG (Formantsynthese). Alles läuft im Browser; Stimmen und Programme liegen auf der Seite selbst.
Wortabdruck: Klang und Aufnahme werden im Browser analysiert und nicht gespeichert. Die stärkste Spektralspitze jedes Zeitfensters wird der nächsten Eigenmode zugeordnet. Das ist eine Übersetzung von Sprache in Form auf der Grundlage eines physikalischen Modells, keine Sprach- oder Stimmerkennung.