🔤
Module 2: Tokenisation et fréquence des mots
Découpez le texte brut en jetons, comptez les fréquences de mots et construisez le vocabulaire de notre modèle de langage.
Leçons
1
Bases de la tokenisation Construisez une fonction tokenize() qui divise le texte brut en jetons de mots propres en utilisant uniquement les méthodes de chaîne.
→ 2 Comptage de fréquence des mots Comptez les jetons dans un dict de fréquence, extrayez les statistiques de vocabulaire et identifiez les mots les plus et les moins courants.
→