🔤
Módulo 2: Tokenización y frecuencia de palabras
Divide el texto crudo en tokens, cuenta las frecuencias de palabras y construye el vocabulario para nuestro modelo de lenguaje.
Lecciones
1
Fundamentos de tokenización Construye una función tokenize() que divida el texto crudo en tokens de palabras limpios usando solo métodos de cadenas.
→ 2 Conteo de frecuencia de palabras Acumula tokens en un dict de frecuencia, extrae estadísticas de vocabulario e identifica las palabras más y menos comunes.
→