Phonetically Boring Languages

11 ספטמבר, 2018 ב- 03:08 | פורסם בEnglish, ג'ון נאש, יצירתי, ספרדית, עברית, פונטיקה, רשימות | כתיבת תגובה

[This may be my longest-sitting draft that I finally made into a post. I started it in June 2017, shortly after this graphic made the rounds.]

After studying phonetics in my first year at Tel-Aviv University, I developed a pet theory. See, every phenomenon we came across that was "unique" (or rare, or marked) seemed to have somehow skipped over the Hebrew language. No crazy nasals, no retroflexes, no gutturals (in the standard Israeli dialect), no clicks, no ingressives, no voiced alveolar lateral fricative, just the five canonical vowels, et cetera. My thoughts were, since Modern Hebrew is a revived language co-learned by people from very distinct linguistic backgrounds in a relatively messy (high-entropy) distribution, the phonetic portion of it evolved to a low-common-denominator, most phonetically boring language out there.

But where there's data, there's a chance to test out pet theories. So as soon as I got word of the phoible dataset I immediately jumped and put my theory to the test (then waited 15 months for absolutely no reason to actually publish my findings).

Phoible is an open, simple-format data source for phonetic inventories of language. A few clicks, and you have a table of all phonemes across all languages. Thus my definition for boringness of language converged to:

A language is boring if it chooses boring sounds for its inventory.

Now I need to figure out which sounds (phonemes) are boring, but that I just define based on their frequency across languages, which gives me a clear algorithm:

  1. Calculate each phoneme's frequency in the database
  2. For each language, calculate average phoneme frequency from its inventory
  3. Rank languages from high to low average (high = boring)

That's it! For my first finding, Modern Hebrew got a score of 0.415, which ranked it 1,426th most boring in a field of 2,155 languages, an utter refutation of my hypothesis. The most boring language according to this metric is Southern Nuautl with a score of 0.764; the most interesting is !xóõ (yes, that's a click sound it's starting with) with an astounding 0.103. The average score was 0.464 and the score progression is a normal-distributed thing of this:

Phonetic Score CDF

(CDF = cumulative distribution function, meaning: y many languages have score up to x)

Here's a taste of some languages I thought could be of interest. Check out that lovely long tail of Igbo, which has may phonemes but a lot of the frequent ones; or how fast Quechua plummets from frequent to semi-frequent to rare phonemes; or how boring Swahili, a high-contact language dominating the 20's of the x-axis, is (it's what I expected the Hebrew situation to be, and even so its score is a very unboring 0.292); or how English falls so quickly in the beginning, with all its weird vowels and labiodentals and taps and flaps.

phon-bor

This could mean a few things about why I didn't get what I expected, as well as some other unrelated reasons:

  1. Like always, data is dirty (or at least, this data, for my analysis needs). In this case, more well-documented languages may have more phonemes in their dataset, probably leading to some that are rare, than languages with less extensive research done upon.
  2. My metric must suck. See how Hebrew has the fewest phonemes in the selected sample? That's gotta account for boringness and yet, with my mean it doesn't. Look how many frequent phonemes Swahili has, and yet its average is very low. Let's consider some other metrics ("Future work". Remind me to upload the data if I don't do so soon):
    1. Number of phonemes (a boring metric for a boringness question)
    2. % of phonemes above a boringness threshold p.
    3. Area under the boringness curve (this is just the sum of boringnesses again – but maybe cut it off at some point?)
    4. Deep neural net trained on all these features with the single data point <Hebrew, TRUE>.
  3. bug in my code. As soon as I find it I see if I can look deeper. I mean it's kind of a miracle that I have the post-processed TSVs around, to be honest.

 

מודעות פרסומת

Mucho wrongo

21 אפריל, 2012 ב- 05:51 | פורסם בספרדית, פונטיקה | 9 תגובות

הדוגמאות לעיוותים פונטיים של תנועות בספרדית בקרב דוברי עברית פשוט נערמות ונערמות: אחרי מונדיאל וטורוסים, הרי שלט שנצפה מהגשר שליד אצטדיון רמת-גן:

תרמיל בספרדית הוא mochila, וממילה זו נגזר הכינוי "מוצ'ילרוס", הלוא-הם תרמילאים.

בטורס עברנו מ-e ל-u (ואולי בהשפעת הוספת הריבוי). במונדיאל עברנו מ-u ל-o. כאן עברנו בדיוק בכיוון ההפוך מבמונדיאל, אך שוב היעד הוא u, כמו בטורס.

התיאוריה שזרקתי בסוף פוסט הטורס, לפיה העיצור שלפני התנועה הוא אולי המשפיע, זה עתה הופרכה. זה בדיוק אותו עיצור, m, והתנועה עוברת תהליך מנוגד. מה שכן, אני נוטה להאמין שבכל זאת יש פה השפעה, אבל הכללתית-לקסיקלית: המילה mucho, שמשמעותה "הרבה", חלה הרבה מאוד בשיחות יומיומיות שמטיילים נקלעים אליהן באמריקה הלטינית, ואולי משהו כבר רגיל אצל הדוברים לדחוף את ה-u בין ה-m וה-ch.

חזרה חזרה

3 אפריל, 2012 ב- 21:21 | פורסם באנגלית, כשל, לקסיקון, ספרדית, עברית, ראיתי-שמעתי, תרגום | כתיבת תגובה

והנה עוד מחוויותינו הלשוניות בפטגוניה, בדגש.

חזרה

30 מרץ, 2012 ב- 14:05 | פורסם בלקסיקון, מנהלי, ספרדית, עברית, פונטיקה | כתיבת תגובה

חזרנו, ואפילו הספקתי לדחוף פוסט נרגן לדגש לפני אפריל! כנסו לקרוא על הטורוסים (לא טורוסים).

כי בתחבולות תעשה לך שלילה

8 אפריל, 2011 ב- 11:07 | פורסם בסמנטיקה, ספרדית, עברית, פרגמטיקה, ראיתי-שמעתי, תרגום | כתיבת תגובה

רצתי, עכשיו יש לי זמן לפרסם את רשומתי החדשה בדגש:

מהי קדם-הנחה? למה שלילה לא מספיקה לבטל אותה? זאת ועוד. (טוב, אין כל-כך עוד)

בוא’נה, מי זה הרקדן החתיך הזה?

23 אוקטובר, 2009 ב- 10:10 | פורסם בוידאו, כוכב נולד, ספרדית | כתיבת תגובה

שלא לדבר על אשתו המושלמת!

(לחסרי הסבלנות, האקשן מתחיל ב-0:58)

יצירה של אתר חינמי או בלוג ב־WordPress.com.
Entries וכן תגובות feeds.