Geral
Processamento de Linguagem Natural
Semana 2
0
Questão
Ao analisar textos com apoio da biblioteca NLTK, é comum trabalhar com corpora estruturados, como poemas, crônicas ou artigos. Esses textos podem ser divididos em unidades menores chamadas tokens, o que permite extrair padrões, calcular frequências e construir representações úteis para diversas finalidades. Operações como normalização, contagem de types e tokenização por sentenças são etapas que influenciam diretamente os resultados da análise.
Com base nesse contexto sobre o uso do NLTK no processamento de um corpus textual. observe as afirmativas a seguir:
Está correto o que se afirma em:
Com base nesse contexto sobre o uso do NLTK no processamento de um corpus textual. observe as afirmativas a seguir:
- A conversão de palavras para letras minúsculas reduz a duplicação de termos equivalentes, como “Amor” e “amor”, contribuindo para uma contagem mais coerente de tokens e types.
- A tokenização lexical distingue todas as ocorrências no texto, incluindo sinais de pontuação, que podem ser considerados unidades de análise dependendo dos objetivos da pesquisa.
- A tokenização de sentenças leva em conta o idioma do texto, o que permite reconhecer fronteiras de frases de forma mais precisa, mesmo diante de abreviações e estruturas ambíguas.
- A contagem de types representa o número de palavras distintas no texto, enquanto a contagem de tokens contabiliza todas as ocorrências, inclusive as repetidas.
Está correto o que se afirma em: