Geral

Processamento de Linguagem Natural

Semana 1 9

#1

Python é uma das linguagens de programação mais utilizadas nos contextos de PLN e processamento de texto. A sintaxe simples e de fácil aprendizado enfatiza a legibilidade da linguagem Python. 

Ainda, suporta módulos e pacotes, o que incentiva a modularidade do programa e a reutilização de código. Dentre os pacotes desenvolvidos em Python para trabalhar com PLN, é possível destacar: 

A

PyTorch e TensorFlow.

B

Google Colab e NLTK.

C

Google Colab e spaCy.

D

NLTK e PyTorch.

E

NLTK e spaCy.

#2

No POS tagging (Part-of-Speech Tagging), o sistema computacional atribui a cada token uma classe gramatical com base na função que a palavra desempenha dentro da sentença. Embora alguns tokens possam ser classificados com base em regras fixas, muitos casos exigem que o sistema avalie o contexto sintático e semântico local. Ambiguidades como essas revelam a necessidade de modelos que vão além de mapeamentos lexicais estáticos.
Com base nesse contexto, avalie as asserções a seguir e a relação proposta entre elas:
I. Em frases como “A nota caiu” e “Nota importante sobre o evento”, um sistema de POS tagging que considera o contexto sintático é capaz de classificar “nota” como substantivo em ambas, mas com estruturas diferentes: na primeira, como sujeito de uma oração verbal; na segunda, como núcleo de um sintagma nominal premodificado por um adjetivo. Essa distinção demonstra a importância da análise estrutural na atribuição de classes gramaticais.
PORQUE
II. Sistemas de POS tagging que utilizam apenas listas de palavras pré-classificadas conseguem inferir corretamente a função de um token, mesmo quando a estrutura da frase permite mais de uma interpretação possível.
A respeito dessas asserções, assinale a alternativa correta:




A

As asserções I e II são proposições falsas.

B

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

C

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

#3

O Processamento de Linguagem Natural (PLN) é uma área que visa permitir que máquinas compreendam, analisem e respondam à linguagem humana de maneira eficaz. Apesar dos avanços nos últimos anos, essa área ainda enfrenta desafios importantes, especialmente na forma como interpreta diferentes nuances do discurso. Elementos como ambiguidade, segmentação de sentenças, variações semânticas e expressões subjetivas dificultam o pleno entendimento por parte dos sistemas computacionais. O desenvolvimento de soluções em PLN exige a análise cuidadosa de situações reais, nas quais a linguagem é processada em contextos diversos.
Considere as situações que ilustram os desafios enfrentados pelas técnicas de Processamento de Linguagem Natural e analise as afirmativas a seguir
  1. Em uma plataforma de suporte bancário, um cliente escreve “fui ao caixa e meu cartão foi engolido”. O sistema identifica apenas as palavras “caixa” e “cartão”, retornando informações sobre limites de crédito, sem compreender que a expressão “foi engolido” refere-se ao bloqueio físico do cartão, o que demonstra limitação na interpretação de expressões idiomáticas contextualizadas.
  2. Em um chatbot de saúde, ao processar a frase “minha pressão tá uma montanha-russa”, o sistema não reconhece o caráter metafórico da expressão e sugere conteúdos sobre parques de diversão, evidenciando a dificuldade de mapear construções figurativas em domínios técnicos.
  3. Durante a análise de avaliações de usuários sobre um aplicativo, uma frase como “esse app é ótimo... só que não” é classificada como positiva, pois o sistema ignora o marcador irônico ao final, revelando a limitação do modelo na interpretação de estruturas discursivas que dependem de negação pragmática e ironia implícita.
  4. Em um sistema de triagem jurídica automatizada, o termo “câmara” presente na frase “decisão da câmara foi publicada” é classificado como relacionado à fotografia, resultando em falha na categorização do documento, que de fato se referia a uma instância legislativa — o que demonstra a fragilidade semântica em ambientes que exigem desambiguação baseada em domínio.

Está correto o que se afirma em:


A

I, II, III e IV.

B

II, III e IV, apenas.

C

I, II e IV, apenas.

D

I, II e III, apenas.

E

I, III e IV, apenas.

#4

Os metacaracteres podem ser compreendidos como um conjunto de símbolos com características próprias que possibilitam buscas generalizadas e específicas em expressões regulares, como: Error converting from MathML to accessible text. (Quanto a sua classificação, os metacaracteres podem ser identificados como: representantes; quantificadores; âncoras; e outros (incluindo metacaracteres relacionais, agrupamento e escape).
Considerando esse contexto e com base nas classificações dos metacaracteres, observe as afirmativas a seguir:
  1. Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text.   pertencem à mesma categoria por permitirem buscas com variações na quantidade de ocorrência de um elemento.
  2. Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text. atuam em posições fixas da string, sendo utilizados para delimitar onde a busca deve começar ou terminar.
  3. Os metacaracteres “.” e “[ ]” podem representar qualquer caractere ou um conjunto definido de caracteres, desempenhando função de substituição em padrões.
  4. Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text. pertencem a categorias distintas, pois um converte símbolos especiais em literais e o outro permite agrupar partes da expressão.

Está correto o que se afirma em:


A

I, II e IV apenas.

B

I, II e III apenas.

C

II, III e IV apenas.

D

I, III e IV apenas.

E

I, II, III e IV.

#5

Em processamento de linguagem natural, fazem parte dos estágios básicos de análise:

A

análise léxica, análise semântica e análise pragmática

B

análise semântica, análise pragmática e NLTK.

C

corpora, tokens e NLTK.

D

análise léxica, análise semântica e deep learning.

E

análise sintática, pré-processamento e classificação de textos.

#6

Chatbots são softwares capazes de conduzir uma conversa por texto, projetados para desenvolver uma conversa da maneira mais semelhante possível à de um ser humano. De acordo com o histórico de PLN, os chatbots sugiram:

A

na década de 2000.

B

na década de 2010

C

na década de 1960.

D

na década de 1990.

E

na década de 2020.

#7

Leia o trecho a seguir: O uso de bibliotecas específicas tem se tornado uma prática comum em projetos de processamento de linguagem natural, sobretudo em ambientes baseados em Python. A NLTK (Natural Language Toolkit) se destaca por oferecer recursos que permitem a manipulação e análise de textos de forma automatizada. Um dos principais diferenciais dessa biblioteca é a disponibilidade de corpora, ou coleções de textos estruturadas, que podem ser utilizadas para treinamento, testes ou estudos linguísticos. A partir dessas coleções, é possível recuperar nomes de arquivos, visualizar textos completos e aplicar técnicas variadas sobre os dados linguísticos extraídos. No ambiente da NLTK, o acesso aos corpora é feito por meio do pacote [preencher 1], que permite carregar diferentes coleções textuais. Para obter a lista de arquivos disponíveis em um corpus, utiliza-se a função [preencher 2], enquanto o conteúdo integral de um arquivo específico pode ser acessado através do método [preencher 3]. Com base nesse contexto, identifique os termos de [preencher 1], [preencher 2] e [preencher 3] que são substituidos por:

A
1-nitk.base; 2- extract(); 3-textfile()
B
1-arquivos; 2 - names(); 3-analyze()
C
1-dataset 2 - openfiles(); 3 - output()
D
1-document; 2-getnames(); 3- content()
E
1-corpus, 2-fileids(); 3-raw()
#8

Uma das metas do processamento de linguagem natural (PLN), que integra o campo da Inteligência artificial, é possibilitar que as máquinas interpretem a linguagem humana de forma eficiente. Para isso, o texto precisa passar por uma preparação que o torne mais simples e estruturado, facilitando a atuação de sistemas computacionais. Esse processo envolve etapas que permitem transformar a linguagem natural em formatos mais adequados para tarefas automáticas. Com base nesse contexto, assinale a alternativa que reconhece uma das etapas fundamentais do pré-processamento de texto em tarefas de PLN.

A
A indexação semântica de termos é a etapa responsável por associar sentidos contextuais às palavras, sendo aplicada antes da organização textua
B
A avaliação de precisão de classificadores é realizada para verificar se o conteúdo do texto está bem estruturado antes de sua segmentação em partes menores
C
A geração de modelos de linguagem permite à máquina prever palavras futuras com base em padrões linguísticos, sendo a primeira etapa do pré-processamento textual
D
A tokenização de palavras visa dividir o texto em unidades mínimas chamadas tokens, separando elementos úteis para análise computacional
E
O treinamento de redes neurais artificiais serve como mecanismo inicial para extrair relações semânticas entre palavras e definir o grau de relevância entre frases
#9

O Processamento de Linguagem Natural (PLN) é uma área que visa permitir que máquinas compreendam, analisem e respondam à linguagem humana de maneira eficaz. Apesar dos avanços nos últimos anos, essa área ainda enfrenta desafios importantes, especialmente na forma como interpreta diferentes nuances do discurso. Elementos como ambiguidade, segmentação de sentenças, variações semânticas e expressões subjetivas dificultam o pleno entendimento por parte dos sistemas computacionais. O desenvolvimento de soluções em PLN exige a análise cuidadosa de situações reais, nas quais a linguagem é processada em contextos diversos. Considere as situações que ilustram os desafios enfrentados pelas técnicas de Processamento de Linguagem Natural e analise as afirmativas a seguir I. Em uma plataforma de suporte bancário, um cliente escreve "fui ao caixa e meu cartão foi engolido". O sistema identifica apenas as palavras "caixa" e "cartão", retornando informações sobre limites de crédito, sem compreender que a expressão "foi engolido" refere-se ao bloqueio físico do cartão, o que demonstra limitação na interpretação de expressões idiomáticas contextualizadas. II. Em um chatbot de saúde, ao processar a frase "minha pressão tá uma montanha-russa", o sistema não reconhece o caráter metafórico da expressão e sugere conteúdos sobre parques de diversão, evidenciando a dificuldade de mapear construções figurativas em domínios técnicos. III. Durante a análise de avaliações de usuários sobre um aplicativo, uma frase como "esse app é ótimo... só que não" é classificada como positiva, pois o sistema ignora o marcador irônico ao final, revelando a limitação do modelo na interpretação de estruturas discursivas que dependem de negação pragmática e ironia implícita. IV. Em um sistema de triagem jurídica automatizada, o termo "câmara" presente na frase "decisão da câmara foi publicada" é classificado como relacionado à fotografia, resultando em falha na categorização do documento, que de fato se referia a uma instância legislativa - o que demonstra a fragilidade semântica em ambientes que exigem desambiguação baseada em domínio. Está correto o que se afirma em:

A
I, III e IV, apenas.
B
I, II, III e IV.
C
II, III e IV, apenas
D
I, II e III, apenas
E
I, II e IV, apenas

Semana 2 11

#1

Em atividades de comparação textual, diferentes técnicas de similaridade podem ser utilizadas com base nas necessidades do contexto e nos tipos de texto que estão envolvidos. Avaliar o funcionamento prático de cada abordagem permite que o analista escolha o método mais eficaz, considerando aspectos como a granularidade, o volume de dados e a finalidade da análise.
Com base nesse contexto, avalie e relacione as abordagens de similaridade com suas respectivas situações de uso. 
Abordagens de SimilaridadeSituações de uso
I. Distância de LevenshteinA. Um filtro de plágio examina trechos curtos de texto com pequenas alterações, como troca de palavras ou mudança na ordem, buscando padrões repetitivos dentro das frases.
II. Similaridade do CossenoB. Um sistema de correção ortográfica compara palavras digitadas com o vocabulário correto, avaliando qual termo exige o menor número de alterações para se tornar válido.
III. Similaridade baseada em N-gramsC. Uma ferramenta de recomendação analisa descrições de produtos em linguagem natural, convertendo-as em vetores para identificar textos com conteúdos semanticamente próximos.

Assinale a alternativa que apresenta a associação correta:


A

I-A; II-B; III-C.

B

I-C; II-B; III-A.

C

I-B; II-C; III-A.

D

I-C; II-A; III-B.

E

I-B; II-A; III-C.

#2

Durante tarefas iniciais de processamento de linguagem natural, técnicas simples de comparação entre cadeias de texto podem ser aplicadas para medir o quanto duas palavras ou sentenças se diferenciam. Essas estratégias são empregadas em aplicações como verificação ortográfica, detecção de nomes semelhantes, comparação entre versões de documentos e suporte a sistemas de recomendação. A mensuração de dissimilaridades entre cadeias de caracteres é, portanto, um passo relevante em diversos contextos computacionais.
Com base nesse contexto, assinale a alternativa que reconhece a principal função da distância de Levenshtein:

A

Estimar a frequência de tokens compartilhados entre textos diferentes com base em regras sintáticas.

B

Calcular a similaridade entre documentos utilizando vetores de representação baseados em palavras.

C

Contar o número de stopwords presentes em duas sentenças para prever sua relevância estatística.

D

Determinar o número mínimo de operações necessárias para transformar uma string em outra.

E

Avaliar o número de palavras comuns entre dois textos para formar um vetor de similaridade semântica.

#3

No processamento de linguagem natural, a análise da similaridade textual permite identificar o grau de proximidade entre dois fragmentos de texto. Essa comparação pode ser realizada com base em diferentes abordagens, dependendo da estrutura e do propósito da aplicação. As duas principais categorias envolvem critérios distintos, que influenciam diretamente nos resultados obtidos ao comparar frases, sentenças ou textos completos.
Com base nesse contexto, assinale a alternativa que identifica o par de categorias utilizadas para a análise da similaridade textual no PLN:

A

Lógica e retórica.

B

Sintática e fonológica.

C

Léxica e semântica.

D

Semântica e fonética.

E

Ortográfica e fonética.

#4

Qual é o valor da similaridade de cossenos entre as frases A e B, conforme a seguir?

 

A – “O Grêmio é copeiro”

B – “Grêmio é copeiro sim”

A

0,60

B

0,25

C

0,75

D

0,30

E

0,50

#5

A análise temporal de um corpus pode revelar padrões linguísticos relacionados à época em que os textos foram produzidos ou ao recorte histórico escolhido. Entender se os dados representam um único período, diversos momentos ou o presente permite categorizar corretamente o tipo de abordagem temporal adotada em uma pesquisa linguística computacional.
Com base nesse contexto, interprete e associe os conceitos de tipos de tempo às suas respectivas interpretações.
Tipos de tempoExemplos interpretativos
I. SincrônicoA. Permite o estudo da evolução da linguagem em jornais de diferentes décadas.
II. DiacrônicoB. A análise de um conjunto de textos da mesma época: comentários de redes sociais em um ano.
III. ContemporâneoC. Abrange textos recentes, como postagens em tempo real de fóruns e blogs sobre tecnologia.

Assinale a alternativa que apresenta a associação correta:


A

I-C; II-B; III-A.

B

I-B; II-A; III-C.

C

I-A; II-C; III-B.

D

I-B; II-C; III-A.

E

I-C; II-A; III-B.

#6

Ao analisar textos com apoio da biblioteca NLTK, é comum trabalhar com corpora estruturados, como poemas, crônicas ou artigos. Esses textos podem ser divididos em unidades menores chamadas tokens, o que permite extrair padrões, calcular frequências e construir representações úteis para diversas finalidades. Operações como normalização, contagem de types e tokenização por sentenças são etapas que influenciam diretamente os resultados da análise.
Com base nesse contexto sobre o uso do NLTK no processamento de um corpus textual. observe as afirmativas a seguir:
  1. A conversão de palavras para letras minúsculas reduz a duplicação de termos equivalentes, como “Amor” e “amor”, contribuindo para uma contagem mais coerente de tokens e types.
  2. A tokenização lexical distingue todas as ocorrências no texto, incluindo sinais de pontuação, que podem ser considerados unidades de análise dependendo dos objetivos da pesquisa.
  3. A tokenização de sentenças leva em conta o idioma do texto, o que permite reconhecer fronteiras de frases de forma mais precisa, mesmo diante de abreviações e estruturas ambíguas.
  4. A contagem de types representa o número de palavras distintas no texto, enquanto a contagem de tokens contabiliza todas as ocorrências, inclusive as repetidas.

Está correto o que se afirma em:


A

I, II e III apenas.

B

II, III e IV apenas.

C

I, III e IV apenas.

D

I, II, III e IV.

E

I, II e IV apenas.

#7

Em grandes conjuntos de dados linguísticos, como corpora de redes sociais ou documentos técnicos, é comum aplicar estatísticas descritivas para identificar padrões. As medidas de tendência central — média, mediana e moda — ajudam a compreender aspectos como frequência de palavras ou idade média dos autores. A escolha da medida adequada depende de características dos dados, como simetria, presença de outliers ou distribuição irregular.
Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas:
I. A mediana pode ser utilizada para representar a idade central de participantes em um corpus de entrevistas, evitando distorções causadas por valores atípicos como a presença de um ou dois participantes muito mais velhos do que os demais,
PORQUE
II. a média continua sendo a melhor escolha para representar dados com valores extremos, pois ela reflete de maneira direta todos os elementos observados na amostra.
A respeito dessas asserções, assinale a alternativa correta:




A

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

B

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

C

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

D

As asserções I e II são falsas.

E

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

#8

Qual é a distância mínima de edição (Minimum Edit Distance) entre as strings “AMOR” e “CALOR”?

A

4

B

2

C

0

D

1

E

3

#9

A análise temporal de um corpus pode revelar padrões linguísticos relacionados à época em que os textos foram produzidos ou ao recorte histórico escolhido. Entender se os dados representam um único período, diversos momentos ou o presente permite categorizar corretamente o tipo de abordagem temporal adotada em uma pesquisa linguística computacional. Com base nesse contexto, interprete e associe os conceitos de tipos de tempo às suas respectivas interpretações. Tipos de tempo Exemplos interpretativos I. Sincrônico A. Permite o estudo da evolução da linguagem em jornais de diferentes décadas. II. Diacrônico B. A análise de um conjunto de textos da mesma época: comentários de redes sociais em um ano. III. Contemporâneo C. Abrange textos recentes, como postagens em tempo real de fóruns e blogs sobre tecnologia. Assinale a alternativa que apresenta a associação correta:

A
I-B; II-C; III-A
B
I-C; II-B; III-A
C
I-B; II-A; III-C
D
I-A; II-C; III-B
E
I-C; II-A; III-B
#10

Leia o trecho a seguir: As técnicas de similaridade textual são fundamentais para que sistemas de processamento de linguagem natural possam comparar, agrupar ou classificar textos com base em sua estrutura. Uma das formas mais utilizadas é a similaridade léxica, que foca na análise de palavras ou caracteres, e não no significado das expressões. A similaridade textual do tipo [preencher 1] mede o quanto duas palavras ou frases se aproximam pela sua forma escrita, desconsiderando o sentido dos termos. Os algoritmos utilizados nesse tipo de análise podem operar com base em [preencher 2], como é o caso das técnicas de distância de edição, ou com base em [preencher 3], como ocorre com métodos que medem a coincidência entre palavras ou tokens idênticos. Neste contexto, reconheça os termos de [preencher 1], [preencher 2] e [preencher 3] que são substituídos por:

A
1-semântica; 2 - gráficos; 3 - fonemas
B
1-estatística; 2 - algoritmos; 3 - traduções
C
1-fonológica; 2 - tokens; 3 - palavras compostas
D
1- gramatical; 2 - letras; 3 - sílabas
E
1-léxica; 2 - caracteres; 3 - termos
#11

Qual é o valor da similaridade de cossenos entre as frases A e B, conforme a seguir? A - "O Grêmio é copeiro" B - "Grêmio é copeiro sim"

A
0,75
B
0,60
C
0,30
D
0,25
E
0,50

Semana 3 8

#1

Dentre as técnicas para extração de informações sobre bases textuais, destacam-se os algoritmos bag of words e TF-IDF. Sobre eles, é correto afirmar:

  1. Um dos maiores problemas do algoritmo bag of words  é não considerar o contexto no qual os termos estão inseridos, levando em conta apenas o número de vezes em que um termo aparece.
  2. O TF-IDF é um dos esquemas de ponderação de termos mais populares, usado por 83% dos sistemas de recomendação baseados em texto nas bibliotecas digitais.
  3. O bag of words  lista o percentual que cada palavra representa em um documento.

 

Selecione a alternativa correta:

A

Somente a afirmação I está correta.

B

Somente a afirmação III está correta.

C

As afirmações I e II estão corretas.

D

As afirmações II e III estão corretas.

E

As afirmações I e III estão corretas

#2

Um n-grama é uma sequência de n elementos em um determinado nível de análise. Considerando a sentença abaixo, qual das alternativas ilustra exemplos de bigramas?

 

“O aluno realizou a prova no tempo previsto.”

A

(o, aluno), (a, prova), (realizou, prova).

B

(aluno, realizou), (tempo, previsto), (a, prova).

C

(a, prova), (o, aluno), (realizou, prova).

D

(o, aluno), (realizou, a, prova), (tempo, previsto).

E

(aluno, prova), (o, aluno), (no, tempo).

#3

Considere os textos a seguir.

 

Texto 1: “Paulo e Cíntia foram ao cinema sem ingressos.”

Texto 2: “E não havia mais ingressos.”

Texto 3: “Paulo comeu bolo e Cíntia comeu pipoca.”

 

Utilizando cada atributo conforme a ordem de ocorrência das palavras, qual seria a representação vetorial do texto 2 utilizando bag of words?

A

(1, 1, 1, 0, 0, 0, 0, 1, 1, 1, 1, 0, 0, 1).

B

(1, 1, 0, 0, 0, 0, 0, 1, 0, 1, 0, 0, 0, 1).

C

(2, 1, 2, 0, 0, 1, 1, 1, 1, 1, 1, 0, 0, 1).

D

(2, 1, 2, 0, 0, 0, 0, 1, 0, 0, 0, 0, 0, 0).

E

(0, 1, 0, 0, 0, 0, 0, 1, 1, 1, 1, 0, 0, 0).

#4

O pacote scikit-learn do Python oferece três principais tipos de vetorizadores de textos.

  1. O peso atribuído a cada termo não depende apenas de sua frequência em um documento, mas também de sua recorrência em todo um conjunto de documentos.
  2. O mais simples conta o número de vezes que um termo aparece no documento e usa esse valor como peso.
  3. Oferece boa eficiência em relação ao uso da memória. A desvantagem desse método reside no fato de que, uma vez vetorizado, os nomes das características não podem mais ser recuperados.

Os métodos descritos acima são, respectivamente:

A

HashVectorizer, TF-IDFVectorizer e CountVectorizer.

B

CountVectorizer , TF-IDFVectorizer e HashVectorizer.

C

HashVectorizer, CountVectorizer e TF-IDFVectorizer.

D

TF-IDFVectorizer, CountVectorizer e HashVectorizer.

E

TF-IDFVectorizer, HashVectorizer e CountVectorizer.

#5

Considere os textos a seguir.

 

Texto 1: “Paulo e Cíntia foram ao cinema sem ingressos.”

Texto 2: “E não havia mais ingressos.”

Texto 3: “Paulo comeu bolo e Cíntia comeu pipoca.”

 

Utilizando cada atributo conforme a ordem de ocorrência das palavras, qual seria a representação vetorial do texto 3 utilizandoTF-IDF?

A

(0,078; 0; 0,078; 0; 0; 0; 0; 0; 0; 0; 0; 0,029; 0,029;0).

B

(0,078; 0; 0,078; 0; 0; 0; 0; 0; 0; 0; 0; 0,078; 0,029; 0,029).

C

(0,029; 0; 0,029; 0; 0; 0; 0; 0; 0; 0; 0; 0,078; 0,078; 0,078).

D

(0,029; 0; 0,029; 0; 0; 0; 0; 0; 0; 0; 0; 0,078; 0,029; 0,029).

E

(0,029; 0,029; 0,029; 0; 0; 0; 0; 0,029; 0; 0; 0; 0; 0; 0,078).

#6

O algoritmo bag of wordsé uma técnica de processamento de linguagem natural usada para extrair características de um texto/documento a partir da contagem da frequência das suas palavras. Nesse contexto, um documento pode ser definido conforme necessário como uma frase única ou toda a Wikipédia.

 

As quatro etapas que compõem o algoritmo bag of words são:

A

geração do texto; extração dos tokens; construção do vocabulário; e geração dos vetores.

B

criação do texto; limpeza do tokens; construção do vocabulário; e geração dos vetores.

C

limpeza do texto; extração dos tokens; construção do vocabulário; e ordenação dos vetores.

D

limpeza do texto; extração dos tokens; construção do vocabulário; e geração dos vetores.

E

criação da sacola (bags); extração das palavras (words); limpeza do vocabulário; e ordenação dos vetores.

#7

A partir de um texto, é possível criar uma estrutura com todas as palavras e suas respectivas contagens no texto. Em Python, isso pode ser feito por meio de um dicionário, no qual a palavra indica a chave e a quantidade aponta para o valor associado à chave. A essa estrutura dá-se o nome de _________________ (lacuna), possibilitando a criação de vetores para cada frase do texto.

 

Selecione a alternativa que apresenta a palavra adequada para preencher a lacuna do texto acima:

A

vetorização

B

bag

C

classe

D

vocabulário

E

ordenação

#8

De posse de diversas bases de dados/documentos, é possível calcular a probabilidade de uma sequência de ocorrências, ou seja, grupo de palavras. Poderíamos especificar tais probabilidades e dizer, por exemplo, que a probabilidade da sentença “o jogador chutou a ____” ser completada com a palavra “bola” é bem maior que com a palavra “mola”. Como exemplo de modelos baseados nessa ideia, é possível citar:

A

bag of words.

B

TF-IDF.

C

modelos sequenciais.

D

modelos n-gramas.

E

probabilidade condicional.

Semana 4 8

#1

Em muitas aplicações de Processamento de Linguagem Natural, é comum trabalhar com grandes volumes de dados textuais que precisam ser organizados, resumidos ou interpretados automaticamente. Diversas técnicas computacionais foram desenvolvidas com o intuito de facilitar a análise desses conteúdos, possibilitando uma melhor compreensão dos textos sem a necessidade de leitura manual. Essas estratégias podem assumir formas variadas, dependendo dos objetivos e da estrutura dos dados analisados.

Com base nesse contexto, assinale a alternativa que reconhece o conceito de modelagem de tópicos.

A
A modelagem de tópicos pode utilizar palavras-chave explícitas como recurso complementar na identificação de temas recorrentes em documentos.
B
A modelagem de tópicos tem como objetivo identificar agrupamentos temáticos por meio de padrões de coocorrência de palavras em documentos.
C
A modelagem de tópicos é uma técnica baseada em aprendizado supervisionado, usada para treinar classificadores com categorias previamente definidas.
D
A modelagem de tópicos considera a distribuição temporal dos textos como um fator relevante para organizar conteúdos de acordo com seus períodos de produção
E
A modelagem de tópicos associa cada documento a um único tema principal, com foco em identificar palavras repetidas em vez de padrões latentes nos textos.
#2

Considere o trecho de código em Python a seguir:

 

def FUNC(model, tagged_data, num_dim):

  matrix = np.zeros((len(tagged_data),num_dim))

  for i inrange(len(tagged_data)):

    matrix[i] = model.docvecs[tagged_data[i][1][0]]

  return matrix

...

model = Doc2Vec(vector_size=100, min_count=2, dm=1, dm_concat = 1,epochs=100)

...

resultado = FUNC(model, tagged_treino, num_dim)

 

O papel da função FUNC é:

A

Criar uma matriz vazia, composta por zeros.

B

Construir um modelo Doc2Vec para representação dos documentos tagged_data. 

C

Construir os vetores de treinamento de um classificador de documentos representados por Doc2Vec.

D

Aumentar a dimensão dos dadostagged_dataque são passados como parâmetro.

E

Realizar o treinamento de um classificador de documentos, representado pela variável model.

#3

Diferentemente das representações clássicas, em que as palavras são representadas simplesmente por uma sequência de caracteres ou como um índice de um vocabulário, word embeddings introduzem o conceito de aprendizado por representação. Sobre word embeddings, é correto afirmar:

 

  1. O conceito de embeddings refere-se a uma representação em um espaço vetorial contínuo de maior dimensionalidade aprendida ou gerada a partir de uma representação de menor dimensionalidade.
  2. As embeddings podem ser aprendidas/geradas para variáveis discretas (ex.: documentos, sentenças e palavras).
  3. A utilização de embeddings facilita a utilização dos algoritmos de aprendizado de máquina, aumentando a velocidade de execução e reduzindo o consumo de memória.

Selecione a alternativa correta:

A

As afirmações I e II estão corretas.

B

Somente a afirmação I está correta.

C

As afirmações I, II e III estão corretas.

D

As afirmações I e III estão corretas.

E

As afirmações II e III estão corretas.

#4

Uma maneira de melhorar as pesquisas por informações digitais é procurar o seu tema, quando se torna possível tanto buscar informações mais específicas quanto mais amplas dentro de um tema, incluindo ainda o acesso ao histórico de como esses temas mudaram ao longo do tempo ou como estão conectados entre si. Assim, em vez de empregar somente palavras-chave, a pesquisa inicia com o tema de interesse e com a análise dos documentos relacionados a esse tema. Nesse contexto, a um conjunto de algoritmos que visam pesquisar sobre grandes arquivos de documentos com informações temáticas, dá-se o nome de:

A

redes neurais artificiais.

B

modelagem de tópicos.

C

aprendizado de máquina.

D

probabilidades.

E

embeddings.

#5

Na biblioteca Gensim, existe uma função de pré-processamento acessível pelo módulo _________________ (lacuna 1) por _________________________ (lacuna 2), que recebe o documento como parâmetro obrigatório e outros três parâmetros opcionais: deacc,min_len e max_len.

 

Selecione a alternativa que apresenta conteúdos adequados para preencher as lacunas do texto acima:

A

pandas e gensim.simple_preprocess().

B

utils e gensim.utils.simple_preprocess().

C

deacc e gensim.utils.preprocess().

D

utils e pandas.utils.simple_preprocess().

E

gesmim e utils.simple_preprocess().

#6

O grande volume de dados disponíveis exige cada vez mais a utilização de ferramentas automatizadas a fim de armazenar, organizar e recuperar informações.

 

Nesse contexto, emprega-se a sumarização de textos para organizar de maneira lógica informações sobre diferentes coleções de dados. Sobre a sumarização de textos, é correto afirmar:

 

  1. Os algoritmos de sumarização automática de textos (SAT) podem ser classificados conforme o número de textos processados.
  2. A sumarização pode ser empregada em diferentes casos, como em notícias, artigos científicos ou prontuários de pacientes de um hospital.
  3. Os objetivos da sumarização se classificam em dois pontos de vista principais: o escritor e o revisor dos textos.

Selecione a alternativa correta:

A

As afirmações II e III estão corretas.

B

Somente a afirmação I está correta.

C

As afirmações I e III estão corretas.

D

As afirmações I e II estão corretas.

E

As afirmações I, II e III estão corretas.

#7

Sobre modelagem de tópicos, é correto afirmar:

 

  1. O resultado da modelagem em tópicos garante exclusividade de tópicos corretos de cada documento.
  2. Diminui a dependência de conhecimentos especializados sobre a coleção ou o domínio, imprescindíveis para interpretar esses tópicos.
  3. Existem grandes chances de os documentos com ideias equivalentes de tópicos ficarem agrupados juntos.

Selecione a alternativa correta:

A

Somente a afirmação III está correta.

B

Somente a afirmação I está correta.

C

As afirmações I e III estão corretas.

D

As afirmações II e III estão corretas.

E

As afirmações I e II estão corretas.

#8

O Latent Dirichlet Allocation (LDA) é um dos modelos de tópicos mais populares, tendo servido como base para criar muitos outros modelos probabilísticos. Sobre LDA, é correto afirmar:

 

  1. É um modelo probabilístico generativo de um corpus.
  2. Pode-se dizer que o modelo LDA foi baseado nos modelos LSA (Latent Semantic Analysis) e pLSI (probabilistic Latent Semantic Indexing).
  3. Cada tópico se caracteriza por uma distribuição de palavras.

 

Selecione a alternativa correta:

A

Somente a afirmação I está correta.

B

As afirmações I e II estão corretas.

C

As afirmações I e III estão corretas.

D

As afirmações II e III estão corretas.

E

As afirmações I, II e III estão corretas.

Semana 5 8

#1

Assuma que a fração de alunos de Graduação indígenas seja de 15%, e que a fração de alunos de Pós-Graduação indígenas seja de 23%.

 

Se 1/5 dos alunos da universidade são de Pós-Graduação (sendo o restante de Graduação), qual a probabilidade de um aluno indígena ser de Graduação?

A

0,834.

B

0,166.

C

0,277.

D

0.046.

E

0,723.

#2

Uma das formas de lidar com tarefas preditivas em aprendizado de máquina, principalmente quando as informações disponíveis são incompletas ou imprecisas, é por meio do uso de algoritmos baseados no teorema de Bayes, os métodos probabilísticos bayesianos.

 

Dentre eles, destaca-se o classificador Naive Bayes, que é considerado ingênuo:

A

porque apresenta bons resultados somente para problemas fáceis.

B

porque lida bem com ruídos, um problema bastante difícil para os outros algoritmos.

C

porque assume que os atributos são independentes.

D

porque não é tolerante a falhas, tornando-o um classificador fraco.

E

porque não é tolerante a falhas como, por exemplo, as redes neurais artificiais.

#3

Assuma que a fração de alunos de Graduação que fuma seja de 15%, e que a fração de alunos de Pós-Graduação que fuma seja de 23%. Se 1/5 dos alunos da universidade são de Pós-Graduação (sendo o restante de Graduação), qual a probabilidade de um aluno fumante ser de Pós-Graduação?

A

0.046.

B

0,277.

C

0,723.

D

0,166.

E

0,834.

#4

Considere a seguinte matriz de confusão com o desempenho de um classificador:

 

Classe Prevista

Classe Verdadeira

P

N

P

25

30

N

25

20

 

O valor da precisioné:

A

50%.

B

55,56%.

C

45,45%.

D

63,64%.

E

41,67%.

#5

São exemplos de tarefas descritivas:

  1. Encontrar regras de associação que associam valores de um subconjunto de atributos preditivos a valores de outro subconjunto.
  2. Diagnóstico médico de pacientes a partir de seus sintomas.
  3. Encontrar grupos de objetos similares entre si em um conjunto de dados.

Selecione a alternativa correta.

A

As afirmações I e III estão corretas.

B

Somente a afirmação I está correta.

C

As afirmações II e III estão corretas.

D

As afirmações I e II estão corretas.

E

As afirmações I, II e III estão corretas.

#6

Em aprendizado de máquina, o conhecimento adquirido pode ser representado de diversas formas. São exemplos de representação de conhecimento:

A

redes semânticas, backpropagation e Naive Bayes.

B

árvores de decisão, redes bayesianas e aprendizado supervisionado.

C

redes semânticas, aprendizado supervisionado e redes neurais artificiais.

D

redes neurais artificiais, árvores de decisão e backpropagation.

E

árvores de decisão, redes neurais artificiais e support vector machines (SMVs).

#7

Considere a seguinte matriz de confusão com o desempenho de um classificador:

 

Classe Prevista

Classe Verdadeira

P

N

P

20

35

N

30

15

 

Os valores de acurácia e erro são, respectivamente:

A

45% e 55%.

B

35% e 65%.

C

65% e 35%.

D

89% e 20%.

E

50% e 50%.

#8

Consideramos a ideia de desenvolver um classificador binário para classificar documentos como “positivo” (éplágio) ou “negativo” (não é plágio). Nesse contexto, podemos afirmar que:

A

um modelo viciado que classifica todos os documentos como “negativo” terá uma acurácia muito boa, já que a grande maioria dos documentos não é plágio. Portanto, a acurácia não é a melhor métrica a ser utilizada para a escolha do melhor modelo.

B

o melhor classificador será aquele que obtiver maior erro no conjunto de treinamento.

C

não é adequado usar F1-score para escolher o melhor classificador, pois trata-se de um problema desbalanceado.

D

é melhor escolher o modelo que classifica todos os documentos como positivo, pois vai gerar o valor máximo de recall.

E

como se trata de um problema balanceado, podemos utilizar o classificador que obtiver a melhor acurácia possível.

Semana 6 8

#1

As redes neurais artificiais (RNAs) destacam-se como um dos principais modelos de aprendizado de máquina. Sobre as RNAs, é correto afirmar:

  1. Uma das vantagens das RNAs é a sua capacidade de generalização.
  2. Os resultados estado-da-arte em áreas como análise de imagens e vídeos foram obtidos por RNAs, em especial por redes neurais profundas.
  3. Uma das vantagens das RNAs é a interpretabilidade do modelo.
  4. Uma desvantagem das RNAs é a dificuldade na escolha dos seus parâmetros, por isso são muitas vezes referenciadas como “caixas-pretas”.

 

Selecione a alternativa correta:

A

As afirmações I, II e IV estão corretas.

B

As afirmações II, III e IV estão corretas.

C

As afirmações I, III e IV estão corretas.

D

As afirmações I e II estão corretas.

E

As afirmações I, II e III estão corretas.

#2

Além do grau de conectividade, as RNAs podem apresentar ou não conexões de retroalimentação, ou feedback. A informação em uma rede neural geralmente flui da camada de entrada da rede para os neurônios da camada de saída. As conexões de retroalimentação permitem que um neurônio receba em seus terminais de entrada a saída de um neurônio da mesma camada ou de uma camada posterior. O neurônio pode, inclusive, receber sua própria saída em um de seus terminais de entrada. Essas redes são conhecidas como:

A

redes feedfoward.

B

redes neurais recorrentes.

C

redes neurais profundas.

D

redes neurais multicamadas (MLP, do inglês Multilayer Perceptron).

E

Adaline.

#3

Sistemas de classificação de texto podem ser compostos por quatro níveis de escopo. São eles:

A

token, parágrafo, sentença e frase.

B

alfabeto, palavra, parágrafo e frase.

C

documento, parágrafo, sentença e frase.

D

documento, token, sentença e frase.

E

token, frase, parágrafo e texto.

#4

Para resolver problemas não linearmente separáveis utilizando RNAs, a alternativa mais empregada é adicionar uma ou mais camadas intermediárias. Uma rede com uma camada intermediária pode implementar qualquer função contínua. A partir de duas camadas intermediárias, é possível aproximar qualquer função, desde que sejam utilizados neurônios suficientes.

 

Sobre as redes Perceptron de múltiplas camadas (MLP, do inglês Multilayer Percetron), é correto afirmar:

  1. Uma rede é completamente conectada quando os neurônios da rede estão conectados a todos os neurônios da camada anterior e/ou seguinte.
  2. A taxa de aprendizado no treinamento da rede representa o quanto a rede já aprendeu e, por isso, valores altos fazem com que as variações dos pesos sejam menores.
  3. Utilizam nas camadas intermediárias funções de ativação não lineares.

 

Selecione a alternativa correta:

A

Somente a afirmação III está correta.

B

Somente a afirmação I está correta.

C

As afirmações II e III estão corretas.

D

As afirmações I e III estão corretas.

E

As afirmações I e II estão corretas.

#5

Com o crescimento acelerado de mídias sociais, os usuários podem expressar suas ideais e opiniões por fóruns, tweets, sites para avaliação de produtos, vídeos, posts etc. Nesse contexto, técnicas de classificação são utilizadas para classificar essas opiniões em, por exemplo, positiva, negativa ou neutra. Esse tipo de aplicação é conhecido por:

A

chatbot.

B

detecção de spam.

C

tradução.

D

análise de sentimentos.

E

detecção de fake news.

#6

A filtragem de informações refere-se à seleção da informação relevante e à retirada de informações irrelevantes a partir de um fluxo de dados recebidos. Uma aplicação prática dessa filtragem de informações é:

A

segmentação de mercado a partir de textos.

B

identificar e-mails indesejados ou spam.

C

tokenização.

D

chatbot.

E

pré-processamento.

#7

Uma das principais vantagens das redes neurais profundas (RNPs) é que elas podem aprender a extrair características relevantes a partir de dados. Existem, inclusive, RNPs voltadas exclusivamente para extração de características, por exemplo:

A

BERT, Doc2Vec e transformers.

B

BERT, Doc2Vec e DNA2Vec.

C

Word2Vec, Doc2Vec e Item2Vec.

D

Embeddings, Doc2Vec e TF-IDF.

E

Word2Vec, Doc2Vec e TF-IDF.

#8

Técnicas de aprendizado de máquina são amplamente utilizadas em classificação de textos. São exemplos de técnicas de classificação:

A

backpropagation e Naive Bayes.

B

aprendizado supervisionado e redes neurais artificiais.

C

árvores de decisão e redes neurais artificiais.

D

árvores de decisão e aprendizado supervisionado.

E

redes neurais artificiais e backpropagation.

Semana 7 5

#1

O objetivo da similaridade textual consiste em verificar o quão “próximos” são dois fragmentos de texto a partir ____________ (lacuna 1) e de ____________ (lacuna 2), em que o primeiro se refere à similaridade ____________ (lacuna 3), e a segunda à similaridade ____________ (lacuna 4).

 

Selecione a alternativa que representa os conteúdos adequados para preencher as lacunas do texto acima:

A

do conhecimento, sua ontologia, semântica, estrutural.

B

do significado, sua estrutura, léxica, semântica.

C

do significado, sua estrutura, semântica, léxica.

D

da estrutura, seu significado, semântica, léxica.

E

da ontologia, sua estrutura, semântica, estrutural.

#2

Considere as seguintes matrizes de confusão representando a avaliação de dois classificadores de sentimentos C1 e C2, respectivamente:


C1

Previsto

Verdadeiro

Positivo

Negativo

Positivo

40

30

Negativo

10

20



C2

Previsto

Verdadeiro

Positivo

Negativo

Positivo

25

40

Negativo

25

10









A partir das avaliações, qual classificador (C1 ou C2) você escolheria? Selecione a alternativa correta:

A

Como trata-se de um problema balanceado, escolhemos C1 simplesmente olhando para a acurácia.

B

Como trata-se de um problema balanceado, escolhemos C2 simplesmente olhando para a acurácia.

C

Trata-se de um problema desbalanceado, portanto seria melhor utilizar o classificador C1.

D

Trata-se de um problema desbalanceado, portanto seria melhor utilizar o classificador C2.

E

Como trata-se de um problema balanceado, podemos escolher tanto C1 quanto C2.

#3

Considere um minerador de emoções, no qual, em um documento analisado, a avaliação “Bom atendimento” aparece 5 vezes, “Agilidade” 3 vezes, e “Qualidade” 1 vez.

As taxas de frequência (TF) normalizadas para “Bom atendimento”, “Agilidade” e “Qualidade”, respectivamente, são:

A

1; 0,6 e 0,2.

B

0,5; 0,3 e 0,1.

C

0,6; 1 e 0,2.

D

0,5; 0,5 e 0.

E

0,55; 0,33 e 0,11.

#4

Em uma ontologia, as relações semânticas representam um tipo de relação entre as palavras e os significados. A relação de parte entre duas palavras, ou seja, uma relação “é parte de” é o tipo de relação denominada:

A

hiponímia.

B

meronímia.

C

sinonímia.

D

antonímia.

E

holonímia.

#5

A classificação de sentimentos a partir de textos é uma das principais aplicações de análise de sentimentos. Considerando o conjunto de dados a seguir, com informações de 8 (oito) textos, qual atributo preditivo (feature, característica) você escolheria para determinar, de forma mais precisa, o sentimento? Se julgar necessário, pode utilizar a equação de Bayes para tomar a decisão.

ID

#AVALIAÇÕES

CATEGORIA

TEM PAIS VIVOS

SENTIMENTO

1

MÉDIA

ESPORTE

SIM

POSITIVO

2

BAIXA

POLICIAL

NÃO

NEGATIVO

3

ALTA

MODA

NÃO

POSITIVO

4

MÉDIA

ESPORTE

NÃO

POSITIVO

5

MÉDIA

POLICIAL

SIM

NEGATIVO

6

ALTA

POLICIAL

NÃO

NEGATIVO

7

BAIXA

ESPORTE

SIM

POSITIVO

8

BAIXA

POLICIAL

SIM

NEGATIVO

A

ID.

B

#AVALIAÇÕES.

C

CATEGORIA.

D

Não é possível utilizar somente um atributo.

E

SENTIMENTO.