Omdat mijn eerstejaarscollege over onder andere de t-toets er weer aankomt, heb ik de code van de T-toets-en-Cohen’s-*d*-calculator nog eens goed bekeken en er wat verbeteringen in aangebracht. Een grote wijziging is de toevoeging van een toets voor normaalverdeling van de data. Ik wilde daarvoor, zoals gebruikelijk is, de Shapiro-Wilk-toets implementeren, maar dat blijkt in PHP nogal lastig te zijn, omdat de berekening afhankelijk is van allerlei matrices en statistieken die niet in PHP ingebed zijn. Daarom heb ik de Lilliefors-toets toegevoegd, die, qua uitkomst althans, ongeveer hetzelfde doet.
De Lilliefors-toets is een variant van de Kolmogorov-Smirnov-toets die wordt gebruikt om te toetsen of data afkomstig zijn uit een normaalverdeling wanneer het gemiddelde en de standaarddeviatie uit de data zelf worden geschat. Het is belangrijk zo’n toets te doen voordat je een *t*-toets op je data loslaat, omdat die toets uitgaat van normaal verdeelde data. Als die aanname niet klopt, kunnen de resultaten van de *t*-toets onbetrouwbaar zijn.
De laatste looptraining voor de Zestig van Texel zit erop — vanmorgen deed ik een nog korte intervaltraining (6 keer 400 meter op 3:40) en ik voelde me aan het einde best gretig. Dat is wel een goed teken, denk ik.
Zoals eerder geschreven zijn de twee taperweken niet ideaal. Zo had ik veel last van een wortelkanaalbehandeling en uiteindelijk het trekken van kies. Vooral de naweeën van die laatste ingreep, die uiteindelijk beter door een kaakchirurg dan door een tandarts uitgevoerd had kunnen worden, duren nog steeds voort, maar de pijn neemt inmiddels wel wat af en ik neem alleen nog in de avond pijnstillers. Daarbij komt dat ik een ontsteking van de peesschede in mijn linkeronderbeen heb en al is die nog niet verdwenen — het gaat wel de goede kant op. We gaan het zien op Texel.
Lastig is te bedenken op welk tempo ik aanstaande zondag wegga. Uiteindelijk zullen het parcours en de omstandigheden een grote rol spelen, maar het is toch wel fijn iets van een richttempo/-tijd hebben, denk ik. Op de website van de Zestig van Texel geeft Gerrit van Rotterdam in zijn trainingsgids de onderstaande tabel met verwachte eindtijden op basis van (weg)marathontijden.
Verwachte eindtijden Zestig van Texel (bron: Van Rotterdam, Gerrit. Trainen voor de Zestig van Texel.
Omdat er een beperkt aantal marathontijden in staat, heb ik een klein calculatortje gemaakt dat op basis van een zelf in te voeren marathontijd een voorspelling geeft die overeenkomt met de genoemde tabel.
Zestig van Texel-calculator
Het gaat expliciet om schattingen. Ik houd me dus niet verantwoordelijk voor de voorspellingen of de gevolgen daarvan. Kijk uit en staar je niet blind op de voorspelde tijd! Dat prent ik mezelf ook in.
Nog een kleine toevoeging aan de Lexical Diversity Calculator: je krijgt nu, na het analyseren van je tekst, ook de gemiddelde zinslengte (in woorden) en de gemiddelde woordlengte (in letters/tekens). (Ook de standaarddeviaties worden daarbij gerapporteerd. Zie overigens Grzybek, 2014 voor een interessant literatuuroverzicht over woordlengte.) Voor sommige onderzoekers is dat nuttig, bijvoorbeeld om te kijken of kinderen steeds langere woorden en zinnen kunnen begrijpen (zie bijvoorbeeld George & Tomasello, 1984 en, een stuk recenter, Potratz, Gildersleeve-Neumann & Redford, 2022).
De gemiddelde zinslengte in het NOS-artikeltje is 15.89 woorden en in het Jeugdjournaal-artikeltje 10.75 woorden. Wat betreft woordlengte is die bij de NOS 5.15 letters, bij het Jeugdjournaal 4.76 letters.
Zinnen en woorden in teksten voor volwassen lijken dus inderdaad langer dan in teksten voor kinderen. De artikeltjes zijn echter veel (en veel!) te kort om echte uitspraken op te kunnen baseren (niet representatief, hoge standaarddeviatie uiteraard), maar dit was dan ook slechts een simpel en klein voorbeeldje.
In the last couple of days, I’ve been implementing various improvements to the Lexical Diversity Calculator. Not only did I fix a problem in the calculation of MTLD, which resulted in numbers that were slightly off, but I’ve also streamlined the calculations and added the calculation of Moving average TTR (MATTR).
2025-05-29: Added choice to use natural logarithm or base 10 in
calculation Maas’s a2, Dugast’s U2, and Herdan’s C.
2025-05-29: Various improvements to calculations and algorithms; added MATTR.
2025-05-26: Important change to the calculation of MTLD, which was slightly off before due to not averaging the forward and backward algorithm.
Next to this, I’m also working on an R-package to easily calculate several measures of lexical diversity, primarily for a research project I’m envisioning for the near future. Stay tuned! For now, please see the online calculator at https://www.reuneker.nl/ld for the newest version.
Wilt u een boxplot bij de t? Flauw, I know, maar dat mag ook wel een keertje. De t-toets-calculator is uitgebreid met boxplots, dus bij elke vergelijking die je nu maakt, verschijnt netjes een grafiek zoals de onderstaande, die hoort bij een vergelijking van (fictieve) examenresultaten.
Boxplot bij een vergelijking van (fictieve) examenresultaten
Het verschil in de scores op het examen Nederlands van 2VA (m = 7.13; sd = 1.3) en 2VB (m = 5.79; sd = 1.37) is significant (t (27) = 2.71; p < 0.05). Het effect is groot (Cohen’s d = 1.01; Cohen, 1988). Dat kun je ook mooi in de grafiek zien; de medianen liggen niet in het bereik van de eerste twee kwartielen (de boxes) en de verdere spreiding (de whiskers) wijken aardig van elkaar af.
De chikwadraattoetscalculator heeft een paar kleine updates ondergaan.
15-4-2025: De resultatentabel wordt omgezet naar ASCII-formaat en meegekopieerd met de rapportage.
12-4-2025: Een p-waarde lager dan 0.001 wordt, conform APA, als p < 0.001 gerapporteerd. Ook is er een knop toegevoegd om voorbeeldwaarden in te voeren.
Naast de nette HTML-tabel nu ook een te kopiëren tabel in platte tekst (ASCII).
I keep finding myself fiddling with treadmill speeds and the calibration thereof. I am fully aware though, that really exact speeds don’t matter that much in running/training, but I just find it fascinating. I also kept finding myself calculating intermittent speeds between two calibrated speeds in a very inefficient way. Now I’ve come to value inefficiency a bit more in the last couple of years (or, better said, I’ve come to devalue efficiency…), but this task was just to repetitious and, to be frank, boring. That’s why I’ve added an interpolation function to the treadmill calculator.
Interpolation for calibrated treadmill speeds
With this new function, you can enter two previously calibrated speeds and calculate the ‘correct’ speeds in between. For instance, when you calculated the true speed of your treadmill at 10 and 16 kph, you can calculate the speeds at 11, 12, 13, 14 and 15 kph. Keep in mind that linear interpolation is used for this, which assumes the deviation of your treadmill is constant. This probably is not an entirely correct assumption, but that’s the margins of the margins, I’d say. Anyway, if you find it useful, let me know!
Laatst wilde ik, voor een voorbeeldje van een toepassing van de t-toets, de lengte van zinnen in twee jeugdromans met elkaar vergelijken. Je raadt: er moest een scriptje komen om zinnen uit teksten te halen en de woorden erin te tellen. Op een paar interpunctiedingetjes na geen lastig klusje, maar waarom niet ook hiervoor een webscriptje schrijven, zodat ik zoiets de volgende keer zonder enige moeite of ook maar een regel code kan doen? Bovendien kunnen ook anderen er op deze manier gebruik van maken.
Op https://www.reuneker.nl/senlen kun je een tekst invoeren en zowel de gemiddelde zinslengte, als een lijst met alle zinnen en hun woordenaantal genereren. Toegegeven, niet iedereen zal hier enthousiast van worden, maar ik heb er best plezier in zoiets te maken en wie weet wanneer en wie het nog eens van pas komt.
Zinslengte in ‘De Stille Kracht’ van Louis Couperus