Teil III · Kapitel 10
Knochen, Farbe und Musik
Was das Skelett weglässt
Neun Kapitel lang haben wir mit dem Knochen gearbeitet. Es hat sich gelohnt: Mit dem Skelett und den Klassen kannst du Verwandtschaften sehen, die vorher unsichtbar waren. Aber jede Methode stellt scharf, und wer scharf stellt, lässt anderes unscharf. Wer nur auf das Skelett eines Wortes schaut, hört vielleicht seine Musik nicht mehr: seinen Ton, seinen Rhythmus, das Gefühl, mit dem es gesagt wird.
Dieser Teil des Buches holt zurück, was wir weggelassen haben. Die Disziplin, die es untersucht, heißt Psychophonologie: die Lehre vom Klang der Sprache als etwas, das an drei Orten zugleich geschieht – in der Struktur, in der Zeit und im Geist. Sie ist ein Vorschlag von mir und arbeitet im Bündnis mit der Endolinguistik. Die Endolinguistik untersucht den Knochen; die Psychophonologie untersucht das Fleisch und die Stimme.
Ein „Nein“, dreimal
Fangen wir mit einem Experiment an, das du sofort machen kannst. Sag das Wort nein auf drei Arten:
- Ein trockenes, hartes, kurzes Nein. Eine Tür, die zuschlägt.
- Ein langes Nein, das zögert, das steigt und fällt. Ein Nein, das sich noch entscheidet.
- Ein kleines, weiches, fast geflüstertes Nein. Ein Nein, das halb eine Bitte ist.
Es ist dasselbe Wort: zwei n und dazwischen ein ei. Für die Grammatik sind alle drei gleich. Und trotzdem weiß, wer dich hört, ganz genau, welches du gesagt hast – und erfährt etwas über dich, das das Wort selbst nicht sagt.
Wo steckt der Unterschied? Die Psychophonologie sagt: Jeder Laut der Sprache lebt auf drei Ebenen zugleich:
- Die Ebene der Struktur: welche Laute es sind, in welcher Reihenfolge. Hier sind die drei Nein gleich.
- Die Ebene der Musik: der Rhythmus, die Dauer, die Melodie der Stimme, wo sie steigt und wo sie fällt. Hier sind alle drei verschieden.
- Die Ebene des Geistes: die Absicht, das Gefühl, die Anspannung dessen, der spricht, und was das in dem auslöst, der zuhört. Hier liegt die Ursache des Unterschieds.
Die drei Ebenen sind keine Schichten, die man voneinander abziehen und einzeln untersuchen kann. Sie sind drei Arten, auf eine einzige Handlung zu schauen. Wenn jemand nein sagt, sagt er alle drei Dinge auf einmal, und wer zuhört, empfängt alle drei auf einmal.
Konsonanten zeichnen, Vokale färben
In Kapitel 2 habe ich dir gesagt, dass die Konsonanten wie ein Umriss sind und die Vokale wie eine Farbe. Jetzt können wir dieses Bild ernst nehmen.
Ein Konsonant ist ein Ereignis: ein Schnitt, eine Kante, ein Augenblick. Deshalb kann man Konsonanten zählen und kombinieren, und deshalb baut man mit ihnen die Codes. Ein Vokal ist ein Zustand: der Mund in einer Form geöffnet, gehalten, klingend. Vokale schneiden die Luft nicht: Sie färben sie.
Und Vokale können sich ohne Sprünge bewegen. Zwischen i und a gibt es unendlich viele Zwischenstellungen; du kannst von einem zum anderen gleiten, ohne abzusetzen. Zwischen p und t dagegen gibt es nichts: Entweder schließt du die Lippen oder nicht. Konsonanten sind wie die Tasten eines Klaviers; Vokale wie der Klang einer Geige, der ganz allmählich höher rutschen kann.
Deshalb sagt die Psychophonologie, der Vokal sei ein Operator der Qualität. Er verändert das Skelett des Wortes nicht: Er gibt ihm eine Farbe. Drei Vokale markieren die Ecken dieses Farbraums, und es sind dieselben drei, die in den Ecken aller Vokalschemata stehen, mit denen Sprachwissenschaftler arbeiten:
- A (wie in Vater): der Mund am weitesten offen. Weite, Öffnung, nach außen.
- I (wie in Kiel): die Zunge hoch und vorn, der Mund fast geschlossen. Das Kleine, das Spitze, das Genaue.
- U (wie in Mut): die Zunge hoch und hinten, die Lippen rund. Das Tiefe, das Dunkle, das Runde.
Alle anderen Vokale wohnen zwischen diesen drei Ecken – auch deine ä, ö und ü.
Bouba oder Kiki?
Dass Vokale eine Farbe haben, ist keine Idee, die nur die Endolinguistik hat. Es ist eines der stabilsten Ergebnisse der experimentellen Sprachpsychologie.
Fast sicher hast du gesagt, dass die runde Bouba heißt und die spitze Kiki. Damit bist du nicht allein: Menschen mit ganz verschiedenen Sprachen und in ganz verschiedenem Alter antworten in der großen Mehrheit der Fälle genauso. Die runden, offenen Vokale von Bouba verbinden sich mit dem Runden; das i und das k von Kiki mit dem Spitzen.
Es gibt ein älteres Experiment. 1929 erfand der Sprachwissenschaftler Edward Sapir zwei Wörter, mil und mal, und erzählte Versuchspersonen, beides seien Namen für Tische: ein großer und ein kleiner. Welcher ist der große? Die meisten wählten mal für den großen Tisch und mil für den kleinen. Das offene a gehört zum Großen, das geschlossene i zum Kleinen.
Jetzt schau dir zwei Wortstücke an, die du sicher kennst, aus dem Griechischen: makro (das Große, Weite) und mikro (das Kleine), wie in Makrokosmos und Mikrofon. Sie haben dasselbe Skelett, m · k · r (das r steht hier nach einem Konsonanten, also zählt es auch in der Standardaussprache). Nur der Vokal ändert sich, und der Vokal scheint die Größe zu tragen: a für groß, i für klein.
Diese Tendenzen sind keine Gesetze. Sie sind Neigungen: Man bemerkt sie, wenn man viele Wörter und viele Menschen betrachtet, und es gibt viele Ausnahmen. Aber sie sind echt, und sie sagen etwas Wichtiges: In der tiefsten Schicht der Sprache, dort, wo der Körper die Laute macht, sind Klang und Sinn nicht ganz voneinander getrennt.
Der Rhythmus entscheidet, was man hört
Gehen wir von der Farbe eines Vokals zur Musik eines ganzen Satzes.
Sprachen haben verschiedene Rhythmen. Das Spanische gibt jeder Silbe ungefähr gleich viel Zeit: cho-co-la-te klingt wie vier gleichmäßige Schläge, und jeder Vokal wird voll ausgesprochen. Das Französische und das Italienische machen es ähnlich. Man sagt, diese Sprachen sind silbenzählend.
Das Deutsche macht es anders, und das Englische auch. Sie schlagen bestimmte Silben kräftig an und drücken die anderen zwischen ihnen zusammen. In Schokolade trägt das la das Gewicht, und das e am Ende wird zu einem schwachen, gemurmelten Laut. Im Englischen schrumpft chocolate sogar auf zwei Silben zusammen, etwa chock-lit. Im Alltag sagen viele von uns ham statt haben und gehn statt gehen. Man sagt, Deutsch und Englisch sind akzentzählend. Derselbe Knochen, in einen anderen Rhythmus gesetzt, klingt anders.
Deshalb hört man es, wenn du Spanisch mit deutschem Rhythmus sprichst – selbst wenn du jeden einzelnen Laut richtig aussprichst. Du drückst Silben zusammen, wo das Spanische sie gleichmäßig hält; du machst aus einem vollen e am Wortende ein gemurmeltes, wo das Spanische es ganz hören will. Was wir Akzent nennen, ist nicht nur ein falscher Vokal hier oder ein falscher Konsonant da. Es ist dein innerer Rhythmus, der deiner ersten Sprache, der unter der neuen Sprache weiterklingt.
Diesen inneren Rhythmus nennt die Endolinguistik Endorhythmus. Er ist nicht der Rhythmus, den man mit einem Mikrofon aufnehmen kann, sondern die Grundhaltung, aus der alle deine Rhythmen kommen: ein Tempo, eine Art, durch die Zeit zu gehen, so persönlich wie die Klangfarbe deiner Stimme. Du trägst ihn mit dir von einem Satz zum nächsten und von einer Sprache zur anderen.
Wenn die Musik das Wort ist
Es gibt Sprachen, in denen die Musik das Wort nicht begleitet: Sie ist ein Teil des Wortes. Man nennt sie Tonsprachen. Im Mandarin-Chinesischen bedeutet die Silbe ma auf einem hohen, gleichbleibenden Ton „Mama“; mit einem steigenden Ton „Hanf“; mit einem Ton, der fällt und wieder steigt, „Pferd“; mit einem Ton, der jäh abfällt, „schimpfen“. Vier verschiedene Wörter mit denselben Lauten. Was im Deutschen ein Konsonant oder ein Vokal erledigen würde, erledigt im Mandarin die Tonhöhe der Stimme.
Und hier gibt es eine schöne Entdeckung der historischen Sprachwissenschaft. Viele Töne sind entstanden, als eine Sprache einen Konsonanten verlor. Der Konsonant verschwand, aber der Unterschied, den er markiert hatte, ging nicht verloren: Er zog in die Melodie des benachbarten Vokals um. Das nennt man Tonogenese, die Geburt des Tons. Es ist, als wäre der Knochen, während er sich abnutzte, zu Musik geworden.
Was die Stimme ohne Worte sagt
Es gibt noch eine feinere Ebene: das kleine Zittern der Stimme, die Pausen, die nicht gleich lang sind, die Kehle, die sich ein wenig zuschnürt, die fast unmerkliche Eile. Die Psychophonologie nennt das Mikromusikalität. Sie liegt unterhalb dessen, was wir bewusst bemerken, und trotzdem lesen wir sie sofort.
Denk an eine zitternde Stimme. Wenn der Mensch friert, ist das Zittern gleichmäßig, mechanisch, rhythmisch: Der Körper bibbert. Wenn der Mensch die Tränen zurückhält, ist das Zittern anders: unregelmäßig, mit ungleichen Pausen, mit einer Spannung, die sich in der Kehle sammelt. Beides hört man. Beides ist Zittern. Und es bedeutet Gegensätzliches. Der Unterschied liegt in keinem Wort und in keinem Laut: Er liegt in der Mikromusikalität.
Was du damit anfängst, wenn du eine Sprache lernst
Dieser Teil klingt vielleicht theoretisch, aber er hat sehr praktische Folgen.
- Wähle einen Referenzakzent und bleib am Anfang dabei. Misch nicht in derselben Woche das Englisch von London mit dem von Texas. Dein Ohr braucht ein stabiles Vorbild.
- Hör zu, bevor du sprichst. Rhythmus und Melodie einer Sprache lernt man über das Ohr, nicht über das Auge. Lass Audio in der Sprache laufen, auch wenn du nicht alles verstehst: Dein Körper lernt dabei den Endorhythmus der anderen Sprache.
- Sprich im Schatten. Spiel einen aufgenommenen Satz ab und sprich ihn fast gleichzeitig mit, darüber, und ahme dabei die Melodie nach, nicht nur die Laute. Auf Englisch heißt das shadowing.
- Übertreib die Musik. Übertreib am Anfang das Steigen und Fallen der neuen Sprache, als würdest du Theater spielen. Beim Englischen passt dein Rhythmustyp schon recht gut; dort übst du vor allem die Melodie. Beim Spanischen, Französischen oder Italienischen zieht dich dein deutscher Rhythmus zum Zusammendrücken und Verschlucken: Gib dort jeder Silbe ihren vollen, gleichmäßigen Schlag.
- Hör parallel. Nutze die Brückensätze aus Kapitel 8: Hör den Satz in der neuen Sprache und dann die Brücke auf Deutsch, einen direkt nach dem anderen. Du trainierst nicht nur die Wörter: Du trainierst den Wechsel des Rhythmus.
Im nächsten Kapitel gehen wir zur tiefsten Frage dieses Teils: Wie wird ein Gedanke, der nicht klingt, zur Stimme?