<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Lexicale diversiteit &#8211; Alex Reuneker</title>
	<atom:link href="https://www.reuneker.nl/tag/lexicale-diversiteit/feed/" rel="self" type="application/rss+xml" />
	<link>https://www.reuneker.nl</link>
	<description>Alex Reuneker&#039;s Blog</description>
	<lastBuildDate>Sat, 06 Jun 2026 09:31:49 +0000</lastBuildDate>
	<language>nl-NL</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.2</generator>
	<item>
		<title>&#167;350. De taal van een dichter: lexicale diversiteit in de genres van Lieke Marsman</title>
		<link>https://www.reuneker.nl/taal/de-taal-van-een-dichter-lexicale-diversiteit-in-de-genres-van-lieke-marsman/</link>
					<comments>https://www.reuneker.nl/taal/de-taal-van-een-dichter-lexicale-diversiteit-in-de-genres-van-lieke-marsman/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Sat, 06 Jun 2026 09:31:49 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[essay]]></category>
		<category><![CDATA[gedicht]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[lieke]]></category>
		<category><![CDATA[marsman]]></category>
		<category><![CDATA[poëzie]]></category>
		<category><![CDATA[roman]]></category>
		<category><![CDATA[woordenschat]]></category>
		<guid isPermaLink="false">https://reuneker.nl/de-taal-van-een-dichter-lexicale-diversiteit-in-de-genres-van-lieke-marsman/?p=355</guid>

					<description><![CDATA[Door Livia Rijkels &#38;amp; Alex Reuneker Lieke Marsman, voormalig Dichter des Vaderlands (2021-2023), overleed deze week op vijfendertigjarige]]></description>
										<content:encoded><![CDATA[<p><em>In samenwerking met <a href="https://www.linkedin.com/in/livia-rijkels-88745b378/?lipi=urn:li:page:d_flagship3_feed;vhrHi70FSE%2bsHy/pjXGClA==" target="_blank" rel="noopener noreferrer">Livia Rijkels</a> voor <a href="https://neerlandistiek.nl/2026/06/de-taal-van-een-dichter/" target="_blank" rel="noopener noreferrer">Jong Neerlandistiek</a>. Dit stuk is een bewerking van een paper dat Livia schreef voor de eerstejaarscursus <a href="https://studiegids.universiteitleiden.nl/courses/134522/taal-en-media" target="_blank" rel="noopener noreferrer">Taal &amp; Media</a>, onderdeel van de bachelor <a href="https://studiegids.universiteitleiden.nl/studies/BA-NED?type=Ba" target="_blank" rel="noopener noreferrer">Nederlandse Taal &amp; Cultuur</a> aan de <a href="https://universiteitleiden.nl" target="_blank" rel="noopener noreferrer">Universiteit Leiden</a>.</em></p>
<p><a href="https://www.liekemarsman.nl/" target="_blank" rel="noopener noreferrer">Lieke Marsman</a>, voormalig Dichter des Vaderlands (2021-2023), overleed deze week op vijfendertigjarige leeftijd. Ze schreef meerdere dichtbundels, een roman en een filosofische essaybundel, die allemaal geprezen werden om de experimentele stijl en creatieve omgang met taal.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20260605143704-marsman_scan.jpg" alt="De volgende scan duurt vijf minuten" /></figure>
<p><em>Gedichten en een essay in Marsmans &#8216;De volgende scan duurt vijf minuten&#8217; (2018). Afbeelding van <a href="https://">Uitgeverij Pluim</a>.</em></p>
<p>Vaak wordt gedacht dat poëtisch taalgebruik afwijkend en ingewikkeld is (<a href="https://www.boom.nl/hoger-onderwijs/100-19094_Op-poetische-wijze" target="_blank" rel="noopener noreferrer">Van Alphen, Duyvendak, Meijer &amp; Peperkamp, 1996</a>). Marsmans diverse oeuvre nodigt uit om te bekijken in hoeverre de woordenschat in haar dichtwerk afwijkt van haar proza en essayistisch werk. Om dat te onderzoeken, stelde ik voor het eerstejaarsvak <a href="https://studiegids.universiteitleiden.nl/courses/134522/taal-en-media" target="_blank" rel="noopener noreferrer">Taal &amp; Media</a> drie kleine steekproeven samen: willekeurige selecties van steeds tien pagina’s uit de dichtbundel <em>In mijn mand</em> (2021), de roman <em>Het tegenovergestelde van een mens</em> (2017) en de essaybundel <em>Op een andere planeet kunnen ze me redden</em> (2025). Voor elke pagina in de steekproeven berekende ik de lexicale diversiteit in termen van <a href="https://neerlandistiek.nl/2025/07/de-brief-en-de-kinderen/" target="_blank" rel="noopener noreferrer">MTLD</a> of <a href="https://neerlandistiek.nl/2025/07/de-brief-en-de-kinderen/" target="_blank" rel="noopener noreferrer">Measure of Textual Lexical Diversity</a>, een maat die goed bestand is tegen verschillen in tekstlengte en lokale woordherhaling (zie <a href="http://www.neerlandistiek.nl/2017/04/sanskriet-op-de-beat/" target="_blank" rel="noopener noreferrer">Reuneker, Waszink &amp; Van der Wouden, 2017</a>). De metingen vergeleek ik door middel van een <a href="https://www.reuneker.nl/files/anova/">ANOVA-toets</a>, om te kijken of ze, per genre in Marsmans werk, verschilden. In figuur 1 zie je dat er inderdaad verschillen zijn, maar die blijken (net) niet significant (F(2, 27) = 2.84, p = 0.07).</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20260605133559-marsman_grafiek.png" alt="MTLD-scores in Marsmans poëzie, roman en essays" /></figure>
<p><em>Figuur 1. MTLD-scores in Marsmans poëzie, roman en essays</em></p>
<p>Het verraste me enigszins dat Marsmans dichtwerk in <em>In mijn mand</em> het laagst scoort op lexicale diversiteit (81,72), gevolgd door de roman <em>Het tegenovergestelde van een mens</em> (102,18) en de essays in <em>Op een andere planeet kunnen ze me redden</em> (114,67). In figuur 1 is echter te zien dat de waarden in de steekproeven flinke variatie vertonen en dat de genres overlappen. Uit post-hocvergelijkingen blijkt dan ook dat de drie genres bij Marsman onderling niet significant verschillen in woordenschat.</p>
<p>De resultaten van dit kleine onderzoekje plaatsen een (eveneens kleine) kanttekening bij het idee dat poëtisch taalgebruik wezenlijk anders is dan ‘ander taalgebruik’. Het werk van Marsman laat dat, ook in de week van haar veel te vroege dood, goed zien. Zij leek zich niet te conformeren aan genreconventies: in haar dichtwerk noemt ze filosofen en hun denkwijzen, in de roman staan sommige hoofdstukken in dichtvorm en zowel de roman als de essaybundel bevat persoonlijke dagboekfragmenten, wederom met filosofische mijmeringen.</p>
<p>Wat de resultaten wellicht laten zien, is niet de afwezigheid van verschillen in woordenschat tussen genres, maar de aanwezigheid van Marsmans eigen, consistente stijl die door genregrenzen heen breekt. Zo schreef <a href="https://www.nrc.nl/nieuws/2026/06/04/met-haar-frisse-en-tegelijk-vurige-poezie-wist-lieke-marsman-35-altijd-dichtbij-te-komen-a4929342" target="_blank" rel="noopener noreferrer">NRC vandaag</a> dat haar poëzie ‘altijd helder, fris en toegankelijk’ was, ‘zonder daarbij hoge barrières of drempels op te werpen. […] Voor haar essayistiek gold hetzelfde […].’ Hoewel woordgebruik invloed heeft op de beeldvorming van literatuur, liet Lieke Marsman in haar werk zien dat je je niet hoeft te houden aan genreconventies, dat je de grenzen zelf bepaalt. Dat woorden essentieel zijn, zei ze zelf misschien wel het treffendst in <em>De volgende scan duurt vijf minuten</em> (2018):</p>
<blockquote>
<p>Op andere momenten word ik overspoeld door wanhoop van de ergste soort, de soort die zich karakteriseert door een gebrek aan woorden: wanhoop die je alleen nog maar kunt omschrijven met het woord wanhoop.</p>
</blockquote>
<p>De waarde van een tekst zit niet in het meetbare, in een toch enigszins afstandelijke benadering als <em>lexicale diversiteit</em>, maar in de daadwerkelijke, individuele lezing. In <a href="https://npo.nl/luister/podcasts/172-vpro-zomergasten/73619" target="_blank" rel="noopener noreferrer">Zomergasten (2022) zei Marsman</a>: ‘Ik wil een oproep tot leven zijn’. Laat dit stukje, ter nagedachtenis aan Lieke Marsman, een bescheiden oproep tot lezen zijn, een oproep haar werk &#8212; gedicht, verhaal of essay &#8212; er dit weekend nog eens bij te pakken en de woorden, haar woorden, op ons in te laten werken.</p>
<p>Livia Rijkels is student <a href="https://www.universiteitleiden.nl/onderwijs/opleidingen/bachelor/nederlandse-taal-en-cultuur" target="_blank" rel="noopener noreferrer">Nederlandse Taal en Cultuur</a> aan de <a href="https://www.universiteitleiden.nl" target="_blank" rel="noopener noreferrer">Universiteit Leiden</a>. Dit artikel is bewerking die zij met <a href="https://www.reuneker.nl">Alex Reuneker</a> maakte van ze een paper dat zij schreef voor zijn eerstejaarscursus <a href="https://studiegids.universiteitleiden.nl/courses/134522/taal-en-media" target="_blank" rel="noopener noreferrer">Taal &amp; Media</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/de-taal-van-een-dichter-lexicale-diversiteit-in-de-genres-van-lieke-marsman/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;258. De brief en de kinderen: zelf lexicale diversiteit berekenen (Neerlandistiek)</title>
		<link>https://www.reuneker.nl/taal/de-brief-en-de-kinderen-zelf-lexicale-diversiteit-berekenen-neerlandistiek/</link>
					<comments>https://www.reuneker.nl/taal/de-brief-en-de-kinderen-zelf-lexicale-diversiteit-berekenen-neerlandistiek/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Fri, 25 Jul 2025 14:28:32 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[beckman]]></category>
		<category><![CDATA[dragt]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[mtld]]></category>
		<category><![CDATA[neerlandistiek]]></category>
		<category><![CDATA[ttr]]></category>
		<guid isPermaLink="false">https://reuneker.nl/de-brief-en-de-kinderen-zelf-lexicale-diversiteit-berekenen-neerlandistiek/?p=297</guid>

					<description><![CDATA[Op Neerlandistiek verscheen vandaag &#039;De brief en de kinderen: zelf lexicale diversiteit berekenen&#039; een stukje van mijn hand over]]></description>
										<content:encoded><![CDATA[<p>Op <a href="https://neerlandistiek.nl/" target="_blank" rel="noopener noreferrer">Neerlandistiek</a> verscheen vandaag <a href="https://neerlandistiek.nl/2025/07/de-brief-en-de-kinderen" target="_blank" rel="noopener noreferrer">&#8216;De brief en de kinderen: zelf lexicale diversiteit berekenen&#8217;</a>, een stukje van mijn hand over woordenschat of &#8216;lexicale diversiteit&#8217;. Aangezien er door studenten de laatste tijd aardig wat over geschreven is &#8212; zie <a href="https://neerlandistiek.nl/2025/07/klassiekers-uit-de-klas/" target="_blank" rel="noopener noreferrer">Luca Lenstra&#8217;s stuk over klassiekers in de kinderliteratuur</a>, <a href="https://neerlandistiek.nl/2025/07/taalverandering-in-duckstad-van-1952-tot-2025/" target="_blank" rel="noopener noreferrer">Hannah de Wildts stuk over Donald Duck</a> en het meest recente stuk van <a href="https://neerlandistiek.nl/2025/07/wie-schrijft-schrijft-gelijk-mannelijke-en-vrouwelijke-auteurs/" target="_blank" rel="noopener noreferrer">Lilith Nugteren over mannelijke en vrouwelijke auteurs</a> &#8212; vroeg <a href="https://neerlandistiek.nl" target="_blank" rel="noopener noreferrer">Neerlandistiek</a> me een stukje te schrijven dat op praktische wijze te laat zien hoe je zelf, als neerlandicus of andere geïnteresseerde, aan de slag kunt met het berekenen van lexicale diversiteit en maten als <a href="https://www.linguisticsweb.org/doku.php?id=linguisticsweb:glossary:type-token-ratio" target="_blank" rel="noopener noreferrer">TTR</a> en <a href="https://link.springer.com/article/10.3758/BRM.42.2.381" target="_blank" rel="noopener noreferrer">MTLD</a>.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250725150614-Scherm%C2%ADafbeelding%202025-07-25%20om%2015.06.01.jpg" alt="&#x27;De brief en de kinderen: zelf lexicale diversiteit berekenen&#x27; op Neerlandistiek" /></figure>
<p><em>&#8216;De brief en de kinderen: zelf lexicale diversiteit berekenen&#8217; op Neerlandistiek</em></p>
<p>Lees het gehele stuk op <a href="https://neerlandistiek.nl/2025/07/de-brief-en-de-kinderen" target="_blank" rel="noopener noreferrer">https://neerlandistiek.nl/2025/07/de-brief-en-de-kinderen</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/de-brief-en-de-kinderen-zelf-lexicale-diversiteit-berekenen-neerlandistiek/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;248. Klassiekers uit de klas! (Jong Neerlandistiek)</title>
		<link>https://www.reuneker.nl/taal/klassiekers-uit-de-klas-jong-neerlandistiek/</link>
					<comments>https://www.reuneker.nl/taal/klassiekers-uit-de-klas-jong-neerlandistiek/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Thu, 03 Jul 2025 13:55:12 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[jeugdliteratuur]]></category>
		<category><![CDATA[kinderboeken]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[media]]></category>
		<category><![CDATA[mtld]]></category>
		<category><![CDATA[taal]]></category>
		<guid isPermaLink="false">https://reuneker.nl/klassiekers-uit-de-klas-jong-neerlandistiek/?p=292</guid>

					<description><![CDATA[Voor het vak Taal &#38;amp; Media dat ik geef bij de studie Nederlandse Taal en Cultuur aan de Universiteit Leiden voeren eerstejaarsstudenten een]]></description>
										<content:encoded><![CDATA[<p>Voor het vak <a href="https://studiegids.universiteitleiden.nl/courses/134522/taal-en-media" target="_blank" rel="noopener noreferrer">Taal &amp; Media</a> dat ik geef bij de studie <a href="https://studiegids.universiteitleiden.nl/studies/10739/nederlandse-taal-en-cultuur" target="_blank" rel="noopener noreferrer">Nederlandse Taal en Cultuur</a> aan de <a href="https://www.universiteitleiden.nl/" target="_blank" rel="noopener noreferrer">Universiteit Leiden</a> voeren eerstejaarsstudenten een corpusonderzoekje uit. Zonde om de mooie inzichten die daaruit voortkomen niet te delen! Daarom herschreven studenten tijdens een workshop van <a href="https://www.linkedin.com/in/ronny-boogaart-b00b525/?lipi=urn:li:page:d_flagship3_detail_base;Fl0XwIypTEuAnAifB6EukQ==" target="_blank" rel="noopener noreferrer">Ronny Boogaart</a> en <a href="https://www.linkedin.com/in/alexreuneker/?lipi=urn:li:page:d_flagship3_detail_base;Fl0XwIypTEuAnAifB6EukQ==" target="_blank" rel="noopener noreferrer">ondergetekende</a> hun paper tot een inspirerende blog voor <a href="https://neerlandistiek.nl/jong-neerlandistiek/" target="_blank" rel="noopener noreferrer">Jong Neerlandistiek</a>. Luca Lenstra trapt af met een stuk over woordenschat in kinderboeken op <a href="https://degrotevriendelijkepodcast.nl/de-gv100/" target="_blank" rel="noopener noreferrer">De Grote Vriendelijke 100</a>-lijst: zijn klassieke of juist recente jeugdboeken beter voor de woordenschat van kinderen? Lees het op <a href="https://neerlandistiek.nl/2025/07/klassiekers-uit-de-klas" target="_blank" rel="noopener noreferrer">https://neerlandistiek.nl/2025/07/klassiekers-uit-de-klas</a>!</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250703135934-Scherm%C2%ADafbeelding%202025-07-03%20om%2012.14.00.jpg" alt="Klassiekers uit de klas!" /></figure>
<p><em><a href="https://neerlandistiek.nl/2025/07/klassiekers-uit-de-klas" target="_blank" rel="noopener noreferrer">Klassiekers uit de klas!</a> door Luca Lenstra</em></p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/klassiekers-uit-de-klas-jong-neerlandistiek/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;242. Gemiddelde woord- en zinslengte</title>
		<link>https://www.reuneker.nl/taal/gemiddelde-woord-en-zinslengte/</link>
					<comments>https://www.reuneker.nl/taal/gemiddelde-woord-en-zinslengte/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Thu, 12 Jun 2025 16:22:34 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[calculator]]></category>
		<category><![CDATA[letter]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[woorden]]></category>
		<category><![CDATA[woordlengte]]></category>
		<category><![CDATA[zinslengte]]></category>
		<guid isPermaLink="false">https://reuneker.nl/gemiddelde-woord-en-zinslengte/?p=290</guid>

					<description><![CDATA[Nog een kleine toevoeging aan de Lexical Diversity Calculator: je krijgt nu, na het analyseren van je tekst, ook de gemiddelde zinslengte (in]]></description>
										<content:encoded><![CDATA[<p>Nog een kleine toevoeging aan de <a href="https://www.reuneker.nl/ld">Lexical Diversity Calculator</a>: je krijgt nu, na het analyseren van je tekst, ook de gemiddelde zinslengte (in woorden) en de gemiddelde woordlengte (in letters/tekens). (Ook de standaarddeviaties worden daarbij gerapporteerd. Zie overigens <a href="https://academic.oup.com/edited-volume/38609/chapter-abstract/334734241?redirectedFrom=fulltext&amp;login=false" target="_blank" rel="noopener noreferrer">Grzybek, 2014</a> voor een interessant literatuuroverzicht over woordlengte.) Voor sommige onderzoekers is dat nuttig, bijvoorbeeld om te kijken of kinderen steeds langere woorden en zinnen kunnen begrijpen (zie bijvoorbeeld <a href="https://journals.sagepub.com/doi/pdf/10.1177/014272378400501403" target="_blank" rel="noopener noreferrer">George &amp; Tomasello, 1984</a> en, een stuk recenter, <a href="https://pubs.asha.org/doi/abs/10.1044/2022_LSHSS-21-00115" target="_blank" rel="noopener noreferrer">Potratz, Gildersleeve-Neumann &amp; Redford, 2022</a>).</p>
<p>Een simpel voorbeeldje. Zowel de <a href="https://nos.nl/artikel/2570851-glazen-huis-van-3fm-dit-jaar-naar-den-bosch-voor-spieren-voor-spieren" target="_blank" rel="noopener noreferrer">website van de NOS</a> als <a href="https://jeugdjournaal.nl/artikel/2570857-goede-doel-voor-3fm-serious-request-bekendgemaakt" target="_blank" rel="noopener noreferrer">de website van het Jeugdjournaal</a> rapporteert over de bekendmaking van het nieuwe goede doel van <a href="https://www.npo3fm.nl/thema/serious-request" target="_blank" rel="noopener noreferrer">3FM Serious Request</a>.</p>
<p>(Afbeelding verwijderd.)</p>
<p>De gemiddelde zinslengte in het NOS-artikeltje is 15.89 woorden en in het Jeugdjournaal-artikeltje 10.75 woorden. Wat betreft woordlengte is die bij de NOS 5.15 letters, bij het Jeugdjournaal 4.76 letters.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250612163257-Scherm%C2%ADafbeelding%202025-06-12%20om%2016.32.49.jpg" alt="Analyse van Jeugdjournaal-tekstje" /></figure>
<p><em>Analyse van het Jeugdjournaal-tekstje over <a href="https://www.npo3fm.nl/thema/serious-request" target="_blank" rel="noopener noreferrer">3FM Serious Request</a></em></p>
<p>Zinnen en woorden in teksten voor volwassen lijken dus inderdaad langer dan in teksten voor kinderen. De artikeltjes zijn echter veel (en veel!) te kort om echte uitspraken op te kunnen baseren (niet representatief, hoge standaarddeviatie uiteraard), maar dit was dan ook slechts een simpel en klein voorbeeldje.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/gemiddelde-woord-en-zinslengte/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;240. Lexicale diversiteit en herhaling: compressieratio</title>
		<link>https://www.reuneker.nl/taal/compressieratio/</link>
					<comments>https://www.reuneker.nl/taal/compressieratio/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Fri, 06 Jun 2025 09:51:49 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[compressie]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[ratio]]></category>
		<category><![CDATA[zlib]]></category>
		<guid isPermaLink="false">https://reuneker.nl/compressieratio/?p=288</guid>

					<description><![CDATA[De Lexical Diversity Calculator berekent nu ook de zogenaamde compression rate; de ratio tussen de lengte van een gecomprimeerde en die van de]]></description>
										<content:encoded><![CDATA[<p>De <a href="http://www.reuneker.nl/files/ld">Lexical Diversity Calculator</a> berekent nu ook de zogenaamde <em><a href="https://en.wikipedia.org/wiki/Data_compression_ratio" target="_blank" rel="noopener noreferrer">compression rate</a></em>; de ratio tussen de lengte van een gecomprimeerde tekst en die van de originele, ongecomprimeerde versie van een tekst. Het idee daarachter is vrij simpel: door een tekst te comprimeren, verklein je het aantal tekens of bytes dat nodig is om de tekst op te slaan. Dat werkt ongeveer als volgt.</p>
<blockquote>
<p>Een tekst bestaat uit woorden en de meeste woorden bestaan uit meerdere tekens. Het woord <em>langeafstandsloper</em> bijvoorbeeld is opgebouwd uit achttien letters. Als dat woord tien keer voorkomt in een tekst, ‘kost’ je dat dus 180 tekens/<em>bytes</em>. Als je een tekst comprimeert, schrijf je een soort woordenboekje bij een tekst, waarin bijvoorbeeld staat dat de letter <em>a</em> eigenlijk staat voor <em>langeafstandsloper</em>. Dat kost je initieel wat opslag, maar elke keer dat het woord daarna voorkomt, bespaar je maar liefst zeventien tekens. Dat scheelt aanzienlijk. Je neemt in dit  voorbeeld immers achttien keer de letter <em>a</em> op in plaats van <em>langeafstandsloper</em> en dat kost je in totaal achttien <em>bytes</em>, een stuk minder dan de 180 <em>bytes</em> in de originele tekst.</p>
</blockquote>
<p>Terug naar het nut van een compressiealgoritme in het licht van lexicale diversiteit; het idee in onderzoek naar herhaling in tekst, zie bijvoorbeeld <a href="https://doi.org/10.1038/s41598-024-55742-x" target="_blank" rel="noopener noreferrer">Parada-Cabaleiro et al. (2024)</a> en <a href="https://srn.com/abstract=2938838" target="_blank" rel="noopener noreferrer">Nunes, Ordanini en Valsesia (2017)</a>, is dat je herhaling kunt ‘meten’ door de compressieratio te berekenen. Hoe meer een tekst gecomprimeerd kan worden, hoe meer herhaling erin moet zitten. Dit is uiteraard best een grove maat van herhaling, maar het voordeel is dat je niet hoeft te bepalen of herhaling zich voordoet op woord-, zins- of een nog ander niveau &#8212; die vraag is immers lastiger te beantwoorden dan je misschien zou denken en er zitten theoretisch ook nog wel wat haken en ogen aan.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250606110130-jackie-alexander-cfxH4rWPqbw-unsplash.jpg" alt="enter image description here" /></figure>
<p><em>Photo by <a href="https://unsplash.com/@jac_kie_co?utm_content=creditCopyText&#038;utm_medium=referral&#038;utm_source=unsplash" target="_blank" rel="noopener noreferrer">Jackie Alexander</a> on <a href="https://unsplash.com/photos/a-black-and-white-poster-with-the-words-tomorrow-cfxH4rWPqbw?utm_content=creditCopyText&#038;utm_medium=referral&#038;utm_source=unsplash" target="_blank" rel="noopener noreferrer">Unsplash</a></em></p>
<p>De compressieberekening in de <a href="http://www.reuneker.nl/files/ld">Lexical Diversity Calculator</a> wordt uitgevoerd met de <a href="https://www.php.net/manual/en/function.gzdeflate.php" target="_blank" rel="noopener noreferrer">deflatie-functie uit zlib</a> in plaats van <a href="https://www.php.net/manual/en/function.gzcompress.php" target="_blank" rel="noopener noreferrer">gzcompress</a>, omdat die laatste functie metadata (<em>headers</em>) toevoegt die korte teksten onevenredig ‘straffen’. Die <em>overhead</em> maakt in relatieve zin namelijk een groter deel uit van het geheel van de gecomprimeerde tekst. De resultaten zijn vergelijkbaar met die van de <a href="https://coderivers.org/blog/python-zlib/" target="_blank" rel="noopener noreferrer">zlib-library</a> in <a href="https://www.python.org/" target="_blank" rel="noopener noreferrer">Python</a> die wordt gebruikt door <a href="https://doi.org/10.1038/s41598-024-55742-x" target="_blank" rel="noopener noreferrer">Parada-Cabaleiro et al. (2024)</a> en met de compress-functie in de <a href="https://cran.r-project.org/web/packages/zlib/zlib.pdf" target="_blank" rel="noopener noreferrer">R-package zlib</a>, die dan ook gebruikt zijn om de ratio’s te evalueren, overigens bij een standaardcompressieniveau van 6 (1-9).</p>
<p>In de nabije toekomst wil ik ook het <a href="https://nl.wikipedia.org/wiki/Lempel_Ziv_Welch" target="_blank" rel="noopener noreferrer">Lempel-Ziv-Welch-algoritme</a> implementeren, zoals dat wordt gebruikt in het onderzoek waarover het Nature-artikel van <a href="https://doi.org/10.1038/s41598-024-55742-x" target="_blank" rel="noopener noreferrer">Parada-Cabaleiro et al. (2024)</a> gaat. Wordt vervolgd dus.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/compressieratio/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;214. Woordenschat en zinslengte in &#039;De brief voor de koning&#039; en &#039;Kinderen van moeder aarde&#039;</title>
		<link>https://www.reuneker.nl/taal/zinslengte-in-de-brief-voor-de-koning-en-kinderen-van-moeder-aarde/</link>
					<comments>https://www.reuneker.nl/taal/zinslengte-in-de-brief-voor-de-koning-en-kinderen-van-moeder-aarde/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Wed, 19 Mar 2025 11:07:21 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[t-toets]]></category>
		<category><![CDATA[thea beckman]]></category>
		<category><![CDATA[tonke dragt]]></category>
		<category><![CDATA[zinslengte]]></category>
		<guid isPermaLink="false">https://reuneker.nl/zinslengte-in-de-brief-voor-de-koning-en-kinderen-van-moeder-aarde/?p=274</guid>

					<description><![CDATA[Bij het eerstejaarsvak [Taal &#38; Media](https://studiegids.universiteitleiden.nl/courses/127692/taal-en-media) van de opleiding [Nederlandse Taal]]></description>
										<content:encoded><![CDATA[<p>Bij het eerstejaarsvak <a href="https://studiegids.universiteitleiden.nl/courses/127692/taal-en-media" target="_blank" rel="noopener noreferrer">Taal &amp; Media</a> van de opleiding <a href="https://studiegids.universiteitleiden.nl/studies/10229/nederlandse-taal-en-cultuur#tab-1" target="_blank" rel="noopener noreferrer">Nederlandse Taal &amp; Cultuur</a> aan de <a href="https://www.universiteitleiden.nl" target="_blank" rel="noopener noreferrer">Universiteit Leiden</a> schrijven studenten een paper over een klein onderzoekje naar een van de besproken onderwerpen. Niet zelden willen ze dan een bepaalde indicatie van tekstniveau vergelijken tussen twee corpora, zoals <a href="https://neerlandistiek.nl/2018/07/als-ik-praat-dan-praat-ik-money/" target="_blank" rel="noopener noreferrer">pop- en rapteksten</a>, <a href="https://neerlandistiek.nl/2024/07/de-woordenschat-van-kinderen-voor-kinderen/" target="_blank" rel="noopener noreferrer">verschillende jaren van Kinderen voor Kinderen</a> of examenteksten. Ze meten dan <a href="https://en.wikipedia.org/wiki/Lexical_diversity" target="_blank" rel="noopener noreferrer">lexicale diversiteit</a> in termen van bijvoorbeeld <a href="https://en.wikipedia.org/wiki/Lexical_diversity" target="_blank" rel="noopener noreferrer">type-token-ratio</a> en/of <a href="https://link.springer.com/article/10.3758/BRM.42.2.381" target="_blank" rel="noopener noreferrer">MTLD</a>.</p>
<p>Om van dergelijke vergelijkingen te kunnen zeggen of verschillen tussen twee corpora significant zijn, kun je de <a href="https://nl.wikipedia.org/wiki/T-toets" target="_blank" rel="noopener noreferrer">t-toets</a> gebruiken. Om studenten in staat te stellen dat te doen zonder uitgebreide statistiek-software te hoeven gebruiken, heb ik een <a href="https://www.reuneker.nl/t">online toegankelijke t-toets-calculator</a> gemaakt. Die waren er natuurlijk al, maar het leek me wel geschikt er een in het Nederlands te maken, die een nette rapportage van de resultaten geeft. Uiteraard moeten studenten in hun paper wel uitleggen hoe die resultaten tot stand zijn gekomen en vooral wat ze betekenen.</p>
<p>Als voorbeeld kijken we naar jeugdliteratuur. Naast lexicale diversiteit wordt ook zinslengte gekoppeld aan tekstniveau; teksten die geschikt zijn voor lagere niveaus zouden minder verschillende woorden bevatten (minder &#8216;lexicaal divers&#8217; zijn) en bovendien kortere zinnen bevatten. Dat staat bijvoorbeeld bij de niveaus op <a href="https://www.lezenvoordelijst.nl/docenten-15-18/leesniveaus/" target="_blank" rel="noopener noreferrer">Lezen voor de lijst</a>, maar ook in <a href="https://tekstblad.nl/nieuws/wat-is-de-ideale-zinslengte" target="_blank" rel="noopener noreferrer">dit stuk in Tekstblad</a>. In dit stukje vergelijken we daarom de lexicale diversiteit en zinslengte in twee klassieke jeugdromans: <a href="https://nl.wikipedia.org/wiki/Tonke_Dragt" target="_blank" rel="noopener noreferrer">Tonke Dragts</a> <a href="https://nl.wikipedia.org/wiki/De_brief_voor_de_koning_%28boek%29" target="_blank" rel="noopener noreferrer">De brief voor de koning</a>, ingeschaald op niveau 1 en <a href="https://nl.wikipedia.org/wiki/Thea_Beckman" target="_blank" rel="noopener noreferrer">Thea Beckmans</a> <a href="https://nl.wikipedia.org/wiki/Kinderen_van_Moeder_Aarde" target="_blank" rel="noopener noreferrer">Kinderen van moeder aarde</a>, ingeschaald op niveau 3. Het eerste boek zou, in principe, minder verschillende woorden en minder lange zinnen moeten bevatten dan het tweede. Dat gaan we toetsten.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250423125805-1742469029744.jpg" alt="enter image description here" /></figure>
<p><em>De brief voor de koning en Kinderen van moeder aarde</em></p>
<p>Om te bepalen in hoeverre boeken op niveaus 1 en 3 verschillen in lexicale diversiteit, nam ik uit beide romans vijftien <em>samples</em> van 500 woorden en ik berekende daar de <em>type-token-ratio&#8217;s</em> (<em>ttr</em>) van. De nulhypothese is dat beide samples niet van elkaar verschillen in <em>type-token-ratio</em>; de alternatieve hypothese is dat beide samples wel van elkaar verschillen in <em>type-token-ratio</em>. Tonke Dragts boek leverde een gemiddelde <em>ttr</em> op van 0.52 (op een schaal van 0-1); voor Thea Beckmans boek was het gemiddelde 0.56.</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250320113925-Scherm%C2%ADafbeelding%202025-03-20%20om%2010.58.33.jpg" alt="enter image description here" /></figure>
<p><em>Uitkomsten van de t-toets (type-token-ratio)</em></p>
<p>Er lijkt dus inderdaad een verschil te zijn tussen de twee boeken, maar is het verschil significant? De t-toets-calculator laat zien van wel, getuige de onderstaande rapportage.</p>
<blockquote>
<p>Op de bovenstaande gegevens is een t-toets toegepast (Reuneker, 2025) om te bepalen of gemiddelden van beide dataverzamelingen, gegeven de variantie, significant van elkaar afwijken. Het verschil in type-token-ratio tussen De brief voor de koning (m = 0.52; sd = 0.03) en Kinderen van moeder aarde (m = 0.56; sd = 0.03) is significant (t (28) = 4.13; p &lt; 0.05). Het (negatieve) effect is zeer groot (Cohen&#8217;s d = 1.51; Cohen, 1988).</p>
</blockquote>
<p>De standaarddeviatie is klein en er blijkt een significant verschil te zijn tussen de romans wat betreft lexicale diversiteit. Dat effect is, volgens de effectmaat Cohen&#8217;s <em>d</em>, groot; een Cohen&#8217;s <em>d</em> van -1.51 komt erop neer dat de  type-token-ratio van een gemiddelde zin in <em>De brief voor de koning</em> 1.5 standaarddeviaties lager is dan die van een gemiddelde zin in <em>Kinderen van moeder aarde</em>. Belangrijk daarbij is dus ook wat tussen haakjes staat: het effect is negatief, wat wil zeggen dat het gemiddelde van de eerste steekproef, Tonke Dragts boek, lager is dan dat van de tweede steekproef, Thea Beckmans boek. Dat is uiteraard ook wat we verwachtten.</p>
<p>Nu de zinslengte; het eerste boek bevat 13.352 zinnen en het tweede boek 11.530. Dat is wat veel voor een t-toets (je riskeert dan overmatige invloed van corpusgrootte op significantie). Voor een inzichtelijk voorbeeld nemen we daarom uit beide boeken 100 willekeurig geselecteerde zinnen. De nulhypothese is dat beide samples niet van elkaar verschillen in zinslengte; de alternatieve hypothese is dat beide samples wel van elkaar verschillen in zinslengte &#8212; een zogenaamde <a href="https://thisvsthat.io/directional-hypothesis-vs-nondirectional-hypothesis" target="_blank" rel="noopener noreferrer">non-directionele hypothese</a>, want we spreken geen verwachting uit over de richting van een mogelijk verschil.</p>
<p>In de steekproef uit Tonke Dragts boek is de gemiddelde zinslengte 10.84 woorden, met een standaarddeviatie van 7.52. Dat zegt dat er flink wat variatie in zinslengtes is. In de steekproef uit Thea Beckmans boek is de gemiddelde zinslengte 12.07 woorden, met een standaarddeviatie van 9.06. We zien dus dat de zinnen in het boek op niveau 3 inderdaad gemiddeld langer zijn. Maar is het verschil groot genoeg om daar conclusies aan te verbinden?</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20250319112040-Scherm%C2%ADafbeelding%202025-03-19%20om%2011.18.38.jpg" alt="enter image description here" /></figure>
<p><em>Uitkomsten van de t-toets (zinslengte)</em></p>
<p>De t-toets geeft een waarde van 1.04 en dat is, gegeven de steekproeven, niet genoeg voor een significant verschil. De onderstaande rapportage, gegenereerd door de calculator, maakt dit duidelijk.</p>
<blockquote>
<p>Op de bovenstaande gegevens is een t-toets toegepast (Reuneker, 2025) om te bepalen of gemiddelden van beide dataverzamelingen, gegeven de variantie, significant van elkaar afwijken. Het verschil in zinslengte tussen De brief voor de koning (m = 10.84; sd = 7.52) en Kinderen van moeder aarde (m = 12.07; sd = 9.06) is niet significant (t (197) = 1.04; p &gt;= 0.05). Het effect is verwaarloosbaar (Cohen&#8217;s d = -0.15; Cohen, 1988).</p>
</blockquote>
<p>Dit resultaat heeft uiteraard met de hoge standaarddeviatie te maken: er is te veel verschil <em>binnen</em> de twee boeken om te kunnen zeggen dat er ook een verschil <em>tussen</em> de boeken is. We concluderen daarom dat we de nulhypothese, namelijk dat er geen verschil is in zinslengte tussen beide boeken, niet kunnen verwerpen.</p>
<p>Samenvattend kunnen we stellen dat <em>De brief voor de koning</em> &#8212; een boek op niveau 1 &#8212; minder lexicaal divers is dan <em>Kinderen van moeder aarde</em> &#8212; een boek op niveau 3, maar dat het niveauverschil zich niet laat zien in zinslengte. Uiteraard is dit maar een voorbeeld met een beperkt corpus, dus verdere conclusies moeten we hier zeker niet aan verbinden, maar als illustratie van zinslengte, lexicale diversiteit en de t-toets volstaat het wel, lijkt me.</p>
<p>Wil je de calculator zelf gebruiken? Ga dan naar <a href="https://www.reuneker.nl/t">https://www.reuneker.nl/t</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/zinslengte-in-de-brief-voor-de-koning-en-kinderen-van-moeder-aarde/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>&#167;183. Van kinderlied tot flexe beat</title>
		<link>https://www.reuneker.nl/taal/van-kinderlied-tot-flexe-beat/</link>
					<comments>https://www.reuneker.nl/taal/van-kinderlied-tot-flexe-beat/#respond</comments>
		
		<dc:creator><![CDATA[Alex]]></dc:creator>
		<pubDate>Tue, 27 Aug 2024 07:08:05 +0000</pubDate>
				<category><![CDATA[Taal]]></category>
		<category><![CDATA[internationale neerlandistiek]]></category>
		<category><![CDATA[keyword analysis]]></category>
		<category><![CDATA[Lexicale diversiteit]]></category>
		<category><![CDATA[zomerschool]]></category>
		<guid isPermaLink="false">https://reuneker.nl/van-kinderlied-tot-flexe-beat/?p=260</guid>

					<description><![CDATA[Tijdens de [Zomerschool voor internationele onderzoekers uit de]]></description>
										<content:encoded><![CDATA[<p>Tijdens de <a href="https://taalunie.org/informatie/400/zomerschool-voor-onderzoekers-uit-de-internationale-neerlandistiek" target="_blank" rel="noopener noreferrer">Zomerschool voor internationele onderzoekers uit de neerlandistiek</a> verzorgden Vivien Waszink en ik de workshop ‘ Van kinderlied tot flexe beat: analyse van lexicale diversiteit en keywords in Nederlandstalige popmuziek’. We vertelden daarin over onze onderzoeken naar de taal van Nederlandse pop en hiphop (zie <a href="https://www.reuneker.nl/">https://www.reuneker.nl</a>), waarbij we focusten op de gebruikte technieken: het meten van lexicale diversiteit (woordenschat) en het extraheren van trefwoorden (keyword analysis).</p>
<figure><img decoding="async" src="/wp-content/uploads/imports/20240827071645-IMG_1711.jpeg" alt="enter image description here" /></figure>
<p>Zo’n vijftien internationale neerlandici deden mee en analyseerden met behulp van de tools op <a href="https://www.reuneker.nl/#corpus">https://www.reuneker.nl/#corpus</a> hun eigen pop- of hiphopfavoriet, waarbij we van alles voorbij zagen komen, van Wim Sonnneveld tot S10.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://www.reuneker.nl/taal/van-kinderlied-tot-flexe-beat/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
