Processamento de Linguagem Natural
Semana 1 9
Python é uma das linguagens de programação mais utilizadas nos contextos de PLN e processamento de texto. A sintaxe simples e de fácil aprendizado enfatiza a legibilidade da linguagem Python.
Ainda, suporta módulos e pacotes, o que incentiva a modularidade do programa e a reutilização de código. Dentre os pacotes desenvolvidos em Python para trabalhar com PLN, é possível destacar:
Com base nesse contexto, avalie as asserções a seguir e a relação proposta entre elas:
I. Em frases como “A nota caiu” e “Nota importante sobre o evento”, um sistema de POS tagging que considera o contexto sintático é capaz de classificar “nota” como substantivo em ambas, mas com estruturas diferentes: na primeira, como sujeito de uma oração verbal; na segunda, como núcleo de um sintagma nominal premodificado por um adjetivo. Essa distinção demonstra a importância da análise estrutural na atribuição de classes gramaticais.
PORQUE
II. Sistemas de POS tagging que utilizam apenas listas de palavras pré-classificadas conseguem inferir corretamente a função de um token, mesmo quando a estrutura da frase permite mais de uma interpretação possível.
A respeito dessas asserções, assinale a alternativa correta:
Considere as situações que ilustram os desafios enfrentados pelas técnicas de Processamento de Linguagem Natural e analise as afirmativas a seguir
- Em uma plataforma de suporte bancário, um cliente escreve “fui ao caixa e meu cartão foi engolido”. O sistema identifica apenas as palavras “caixa” e “cartão”, retornando informações sobre limites de crédito, sem compreender que a expressão “foi engolido” refere-se ao bloqueio físico do cartão, o que demonstra limitação na interpretação de expressões idiomáticas contextualizadas.
- Em um chatbot de saúde, ao processar a frase “minha pressão tá uma montanha-russa”, o sistema não reconhece o caráter metafórico da expressão e sugere conteúdos sobre parques de diversão, evidenciando a dificuldade de mapear construções figurativas em domínios técnicos.
- Durante a análise de avaliações de usuários sobre um aplicativo, uma frase como “esse app é ótimo... só que não” é classificada como positiva, pois o sistema ignora o marcador irônico ao final, revelando a limitação do modelo na interpretação de estruturas discursivas que dependem de negação pragmática e ironia implícita.
- Em um sistema de triagem jurídica automatizada, o termo “câmara” presente na frase “decisão da câmara foi publicada” é classificado como relacionado à fotografia, resultando em falha na categorização do documento, que de fato se referia a uma instância legislativa — o que demonstra a fragilidade semântica em ambientes que exigem desambiguação baseada em domínio.
Está correto o que se afirma em:
Considerando esse contexto e com base nas classificações dos metacaracteres, observe as afirmativas a seguir:
- Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text. pertencem à mesma categoria por permitirem buscas com variações na quantidade de ocorrência de um elemento.
- Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text. atuam em posições fixas da string, sendo utilizados para delimitar onde a busca deve começar ou terminar.
- Os metacaracteres “.” e “[ ]” podem representar qualquer caractere ou um conjunto definido de caracteres, desempenhando função de substituição em padrões.
- Os metacaracteres Error converting from MathML to accessible text. e Error converting from MathML to accessible text. pertencem a categorias distintas, pois um converte símbolos especiais em literais e o outro permite agrupar partes da expressão.
Está correto o que se afirma em:
Em processamento de linguagem natural, fazem parte dos estágios básicos de análise:
Chatbots são softwares capazes de conduzir uma conversa por texto, projetados para desenvolver uma conversa da maneira mais semelhante possível à de um ser humano. De acordo com o histórico de PLN, os chatbots sugiram:
Leia o trecho a seguir: O uso de bibliotecas específicas tem se tornado uma prática comum em projetos de processamento de linguagem natural, sobretudo em ambientes baseados em Python. A NLTK (Natural Language Toolkit) se destaca por oferecer recursos que permitem a manipulação e análise de textos de forma automatizada. Um dos principais diferenciais dessa biblioteca é a disponibilidade de corpora, ou coleções de textos estruturadas, que podem ser utilizadas para treinamento, testes ou estudos linguísticos. A partir dessas coleções, é possível recuperar nomes de arquivos, visualizar textos completos e aplicar técnicas variadas sobre os dados linguísticos extraídos. No ambiente da NLTK, o acesso aos corpora é feito por meio do pacote [preencher 1], que permite carregar diferentes coleções textuais. Para obter a lista de arquivos disponíveis em um corpus, utiliza-se a função [preencher 2], enquanto o conteúdo integral de um arquivo específico pode ser acessado através do método [preencher 3]. Com base nesse contexto, identifique os termos de [preencher 1], [preencher 2] e [preencher 3] que são substituidos por:
Uma das metas do processamento de linguagem natural (PLN), que integra o campo da Inteligência artificial, é possibilitar que as máquinas interpretem a linguagem humana de forma eficiente. Para isso, o texto precisa passar por uma preparação que o torne mais simples e estruturado, facilitando a atuação de sistemas computacionais. Esse processo envolve etapas que permitem transformar a linguagem natural em formatos mais adequados para tarefas automáticas. Com base nesse contexto, assinale a alternativa que reconhece uma das etapas fundamentais do pré-processamento de texto em tarefas de PLN.
O Processamento de Linguagem Natural (PLN) é uma área que visa permitir que máquinas compreendam, analisem e respondam à linguagem humana de maneira eficaz. Apesar dos avanços nos últimos anos, essa área ainda enfrenta desafios importantes, especialmente na forma como interpreta diferentes nuances do discurso. Elementos como ambiguidade, segmentação de sentenças, variações semânticas e expressões subjetivas dificultam o pleno entendimento por parte dos sistemas computacionais. O desenvolvimento de soluções em PLN exige a análise cuidadosa de situações reais, nas quais a linguagem é processada em contextos diversos. Considere as situações que ilustram os desafios enfrentados pelas técnicas de Processamento de Linguagem Natural e analise as afirmativas a seguir I. Em uma plataforma de suporte bancário, um cliente escreve "fui ao caixa e meu cartão foi engolido". O sistema identifica apenas as palavras "caixa" e "cartão", retornando informações sobre limites de crédito, sem compreender que a expressão "foi engolido" refere-se ao bloqueio físico do cartão, o que demonstra limitação na interpretação de expressões idiomáticas contextualizadas. II. Em um chatbot de saúde, ao processar a frase "minha pressão tá uma montanha-russa", o sistema não reconhece o caráter metafórico da expressão e sugere conteúdos sobre parques de diversão, evidenciando a dificuldade de mapear construções figurativas em domínios técnicos. III. Durante a análise de avaliações de usuários sobre um aplicativo, uma frase como "esse app é ótimo... só que não" é classificada como positiva, pois o sistema ignora o marcador irônico ao final, revelando a limitação do modelo na interpretação de estruturas discursivas que dependem de negação pragmática e ironia implícita. IV. Em um sistema de triagem jurídica automatizada, o termo "câmara" presente na frase "decisão da câmara foi publicada" é classificado como relacionado à fotografia, resultando em falha na categorização do documento, que de fato se referia a uma instância legislativa - o que demonstra a fragilidade semântica em ambientes que exigem desambiguação baseada em domínio. Está correto o que se afirma em:
Semana 2 11
Com base nesse contexto, avalie e relacione as abordagens de similaridade com suas respectivas situações de uso.
| Abordagens de Similaridade | Situações de uso |
| I. Distância de Levenshtein | A. Um filtro de plágio examina trechos curtos de texto com pequenas alterações, como troca de palavras ou mudança na ordem, buscando padrões repetitivos dentro das frases. |
| II. Similaridade do Cosseno | B. Um sistema de correção ortográfica compara palavras digitadas com o vocabulário correto, avaliando qual termo exige o menor número de alterações para se tornar válido. |
| III. Similaridade baseada em N-grams | C. Uma ferramenta de recomendação analisa descrições de produtos em linguagem natural, convertendo-as em vetores para identificar textos com conteúdos semanticamente próximos. |
Assinale a alternativa que apresenta a associação correta:
Com base nesse contexto, assinale a alternativa que reconhece a principal função da distância de Levenshtein:
Com base nesse contexto, assinale a alternativa que identifica o par de categorias utilizadas para a análise da similaridade textual no PLN:
Qual é o valor da similaridade de cossenos entre as frases A e B, conforme a seguir?
A – “O Grêmio é copeiro”
B – “Grêmio é copeiro sim”
Com base nesse contexto, interprete e associe os conceitos de tipos de tempo às suas respectivas interpretações.
| Tipos de tempo | Exemplos interpretativos |
| I. Sincrônico | A. Permite o estudo da evolução da linguagem em jornais de diferentes décadas. |
| II. Diacrônico | B. A análise de um conjunto de textos da mesma época: comentários de redes sociais em um ano. |
| III. Contemporâneo | C. Abrange textos recentes, como postagens em tempo real de fóruns e blogs sobre tecnologia. |
Assinale a alternativa que apresenta a associação correta:
Com base nesse contexto sobre o uso do NLTK no processamento de um corpus textual. observe as afirmativas a seguir:
- A conversão de palavras para letras minúsculas reduz a duplicação de termos equivalentes, como “Amor” e “amor”, contribuindo para uma contagem mais coerente de tokens e types.
- A tokenização lexical distingue todas as ocorrências no texto, incluindo sinais de pontuação, que podem ser considerados unidades de análise dependendo dos objetivos da pesquisa.
- A tokenização de sentenças leva em conta o idioma do texto, o que permite reconhecer fronteiras de frases de forma mais precisa, mesmo diante de abreviações e estruturas ambíguas.
- A contagem de types representa o número de palavras distintas no texto, enquanto a contagem de tokens contabiliza todas as ocorrências, inclusive as repetidas.
Está correto o que se afirma em:
Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas:
I. A mediana pode ser utilizada para representar a idade central de participantes em um corpus de entrevistas, evitando distorções causadas por valores atípicos como a presença de um ou dois participantes muito mais velhos do que os demais,
PORQUE
II. a média continua sendo a melhor escolha para representar dados com valores extremos, pois ela reflete de maneira direta todos os elementos observados na amostra.
A respeito dessas asserções, assinale a alternativa correta:
Qual é a distância mínima de edição (Minimum Edit Distance) entre as strings “AMOR” e “CALOR”?
A análise temporal de um corpus pode revelar padrões linguísticos relacionados à época em que os textos foram produzidos ou ao recorte histórico escolhido. Entender se os dados representam um único período, diversos momentos ou o presente permite categorizar corretamente o tipo de abordagem temporal adotada em uma pesquisa linguística computacional. Com base nesse contexto, interprete e associe os conceitos de tipos de tempo às suas respectivas interpretações. Tipos de tempo Exemplos interpretativos I. Sincrônico A. Permite o estudo da evolução da linguagem em jornais de diferentes décadas. II. Diacrônico B. A análise de um conjunto de textos da mesma época: comentários de redes sociais em um ano. III. Contemporâneo C. Abrange textos recentes, como postagens em tempo real de fóruns e blogs sobre tecnologia. Assinale a alternativa que apresenta a associação correta:
Leia o trecho a seguir: As técnicas de similaridade textual são fundamentais para que sistemas de processamento de linguagem natural possam comparar, agrupar ou classificar textos com base em sua estrutura. Uma das formas mais utilizadas é a similaridade léxica, que foca na análise de palavras ou caracteres, e não no significado das expressões. A similaridade textual do tipo [preencher 1] mede o quanto duas palavras ou frases se aproximam pela sua forma escrita, desconsiderando o sentido dos termos. Os algoritmos utilizados nesse tipo de análise podem operar com base em [preencher 2], como é o caso das técnicas de distância de edição, ou com base em [preencher 3], como ocorre com métodos que medem a coincidência entre palavras ou tokens idênticos. Neste contexto, reconheça os termos de [preencher 1], [preencher 2] e [preencher 3] que são substituídos por:
Qual é o valor da similaridade de cossenos entre as frases A e B, conforme a seguir? A - "O Grêmio é copeiro" B - "Grêmio é copeiro sim"
Semana 3 8
Dentre as técnicas para extração de informações sobre bases textuais, destacam-se os algoritmos bag of words e TF-IDF. Sobre eles, é correto afirmar:
- Um dos maiores problemas do algoritmo bag of words é não considerar o contexto no qual os termos estão inseridos, levando em conta apenas o número de vezes em que um termo aparece.
- O TF-IDF é um dos esquemas de ponderação de termos mais populares, usado por 83% dos sistemas de recomendação baseados em texto nas bibliotecas digitais.
- O bag of words lista o percentual que cada palavra representa em um documento.
Selecione a alternativa correta:
Um n-grama é uma sequência de n elementos em um determinado nível de análise. Considerando a sentença abaixo, qual das alternativas ilustra exemplos de bigramas?
“O aluno realizou a prova no tempo previsto.”
Considere os textos a seguir.
Texto 1: “Paulo e Cíntia foram ao cinema sem ingressos.”
Texto 2: “E não havia mais ingressos.”
Texto 3: “Paulo comeu bolo e Cíntia comeu pipoca.”
Utilizando cada atributo conforme a ordem de ocorrência das palavras, qual seria a representação vetorial do texto 2 utilizando bag of words?
O pacote scikit-learn do Python oferece três principais tipos de vetorizadores de textos.
- O peso atribuído a cada termo não depende apenas de sua frequência em um documento, mas também de sua recorrência em todo um conjunto de documentos.
- O mais simples conta o número de vezes que um termo aparece no documento e usa esse valor como peso.
- Oferece boa eficiência em relação ao uso da memória. A desvantagem desse método reside no fato de que, uma vez vetorizado, os nomes das características não podem mais ser recuperados.
Os métodos descritos acima são, respectivamente:
Considere os textos a seguir.
Texto 1: “Paulo e Cíntia foram ao cinema sem ingressos.”
Texto 2: “E não havia mais ingressos.”
Texto 3: “Paulo comeu bolo e Cíntia comeu pipoca.”
Utilizando cada atributo conforme a ordem de ocorrência das palavras, qual seria a representação vetorial do texto 3 utilizandoTF-IDF?
O algoritmo bag of wordsé uma técnica de processamento de linguagem natural usada para extrair características de um texto/documento a partir da contagem da frequência das suas palavras. Nesse contexto, um documento pode ser definido conforme necessário como uma frase única ou toda a Wikipédia.
As quatro etapas que compõem o algoritmo bag of words são:
A partir de um texto, é possível criar uma estrutura com todas as palavras e suas respectivas contagens no texto. Em Python, isso pode ser feito por meio de um dicionário, no qual a palavra indica a chave e a quantidade aponta para o valor associado à chave. A essa estrutura dá-se o nome de _________________ (lacuna), possibilitando a criação de vetores para cada frase do texto.
Selecione a alternativa que apresenta a palavra adequada para preencher a lacuna do texto acima:
De posse de diversas bases de dados/documentos, é possível calcular a probabilidade de uma sequência de ocorrências, ou seja, grupo de palavras. Poderíamos especificar tais probabilidades e dizer, por exemplo, que a probabilidade da sentença “o jogador chutou a ____” ser completada com a palavra “bola” é bem maior que com a palavra “mola”. Como exemplo de modelos baseados nessa ideia, é possível citar:
Semana 4 8
Com base nesse contexto, assinale a alternativa que reconhece o conceito de modelagem de tópicos.
Considere o trecho de código em Python a seguir:
def FUNC(model, tagged_data, num_dim):
matrix = np.zeros((len(tagged_data),num_dim))
for i inrange(len(tagged_data)):
matrix[i] = model.docvecs[tagged_data[i][1][0]]
return matrix
...
model = Doc2Vec(vector_size=100, min_count=2, dm=1, dm_concat = 1,epochs=100)
...
resultado = FUNC(model, tagged_treino, num_dim)
O papel da função FUNC é:
Diferentemente das representações clássicas, em que as palavras são representadas simplesmente por uma sequência de caracteres ou como um índice de um vocabulário, word embeddings introduzem o conceito de aprendizado por representação. Sobre word embeddings, é correto afirmar:
- O conceito de embeddings refere-se a uma representação em um espaço vetorial contínuo de maior dimensionalidade aprendida ou gerada a partir de uma representação de menor dimensionalidade.
- As embeddings podem ser aprendidas/geradas para variáveis discretas (ex.: documentos, sentenças e palavras).
- A utilização de embeddings facilita a utilização dos algoritmos de aprendizado de máquina, aumentando a velocidade de execução e reduzindo o consumo de memória.
Selecione a alternativa correta:
Uma maneira de melhorar as pesquisas por informações digitais é procurar o seu tema, quando se torna possível tanto buscar informações mais específicas quanto mais amplas dentro de um tema, incluindo ainda o acesso ao histórico de como esses temas mudaram ao longo do tempo ou como estão conectados entre si. Assim, em vez de empregar somente palavras-chave, a pesquisa inicia com o tema de interesse e com a análise dos documentos relacionados a esse tema. Nesse contexto, a um conjunto de algoritmos que visam pesquisar sobre grandes arquivos de documentos com informações temáticas, dá-se o nome de:
Na biblioteca Gensim, existe uma função de pré-processamento acessível pelo módulo _________________ (lacuna 1) por _________________________ (lacuna 2), que recebe o documento como parâmetro obrigatório e outros três parâmetros opcionais: deacc,min_len e max_len.
Selecione a alternativa que apresenta conteúdos adequados para preencher as lacunas do texto acima:
O grande volume de dados disponíveis exige cada vez mais a utilização de ferramentas automatizadas a fim de armazenar, organizar e recuperar informações.
Nesse contexto, emprega-se a sumarização de textos para organizar de maneira lógica informações sobre diferentes coleções de dados. Sobre a sumarização de textos, é correto afirmar:
- Os algoritmos de sumarização automática de textos (SAT) podem ser classificados conforme o número de textos processados.
- A sumarização pode ser empregada em diferentes casos, como em notícias, artigos científicos ou prontuários de pacientes de um hospital.
- Os objetivos da sumarização se classificam em dois pontos de vista principais: o escritor e o revisor dos textos.
Selecione a alternativa correta:
Sobre modelagem de tópicos, é correto afirmar:
- O resultado da modelagem em tópicos garante exclusividade de tópicos corretos de cada documento.
- Diminui a dependência de conhecimentos especializados sobre a coleção ou o domínio, imprescindíveis para interpretar esses tópicos.
- Existem grandes chances de os documentos com ideias equivalentes de tópicos ficarem agrupados juntos.
Selecione a alternativa correta:
O Latent Dirichlet Allocation (LDA) é um dos modelos de tópicos mais populares, tendo servido como base para criar muitos outros modelos probabilísticos. Sobre LDA, é correto afirmar:
- É um modelo probabilístico generativo de um corpus.
- Pode-se dizer que o modelo LDA foi baseado nos modelos LSA (Latent Semantic Analysis) e pLSI (probabilistic Latent Semantic Indexing).
- Cada tópico se caracteriza por uma distribuição de palavras.
Selecione a alternativa correta:
Semana 5 8
Assuma que a fração de alunos de Graduação indígenas seja de 15%, e que a fração de alunos de Pós-Graduação indígenas seja de 23%.
Se 1/5 dos alunos da universidade são de Pós-Graduação (sendo o restante de Graduação), qual a probabilidade de um aluno indígena ser de Graduação?
Uma das formas de lidar com tarefas preditivas em aprendizado de máquina, principalmente quando as informações disponíveis são incompletas ou imprecisas, é por meio do uso de algoritmos baseados no teorema de Bayes, os métodos probabilísticos bayesianos.
Dentre eles, destaca-se o classificador Naive Bayes, que é considerado ingênuo:
Assuma que a fração de alunos de Graduação que fuma seja de 15%, e que a fração de alunos de Pós-Graduação que fuma seja de 23%. Se 1/5 dos alunos da universidade são de Pós-Graduação (sendo o restante de Graduação), qual a probabilidade de um aluno fumante ser de Pós-Graduação?
Considere a seguinte matriz de confusão com o desempenho de um classificador:
|
Classe Prevista |
Classe Verdadeira |
|
|
P |
N |
|
|
P |
25 |
30 |
|
N |
25 |
20 |
O valor da precisioné:
São exemplos de tarefas descritivas:
- Encontrar regras de associação que associam valores de um subconjunto de atributos preditivos a valores de outro subconjunto.
- Diagnóstico médico de pacientes a partir de seus sintomas.
- Encontrar grupos de objetos similares entre si em um conjunto de dados.
Selecione a alternativa correta.
Em aprendizado de máquina, o conhecimento adquirido pode ser representado de diversas formas. São exemplos de representação de conhecimento:
Considere a seguinte matriz de confusão com o desempenho de um classificador:
Classe Prevista | Classe Verdadeira | |
P | N | |
P | 20 | 35 |
N | 30 | 15 |
Os valores de acurácia e erro são, respectivamente:
Consideramos a ideia de desenvolver um classificador binário para classificar documentos como “positivo” (éplágio) ou “negativo” (não é plágio). Nesse contexto, podemos afirmar que:
Semana 6 8
As redes neurais artificiais (RNAs) destacam-se como um dos principais modelos de aprendizado de máquina. Sobre as RNAs, é correto afirmar:
- Uma das vantagens das RNAs é a sua capacidade de generalização.
- Os resultados estado-da-arte em áreas como análise de imagens e vídeos foram obtidos por RNAs, em especial por redes neurais profundas.
- Uma das vantagens das RNAs é a interpretabilidade do modelo.
- Uma desvantagem das RNAs é a dificuldade na escolha dos seus parâmetros, por isso são muitas vezes referenciadas como “caixas-pretas”.
Selecione a alternativa correta:
Além do grau de conectividade, as RNAs podem apresentar ou não conexões de retroalimentação, ou feedback. A informação em uma rede neural geralmente flui da camada de entrada da rede para os neurônios da camada de saída. As conexões de retroalimentação permitem que um neurônio receba em seus terminais de entrada a saída de um neurônio da mesma camada ou de uma camada posterior. O neurônio pode, inclusive, receber sua própria saída em um de seus terminais de entrada. Essas redes são conhecidas como:
Sistemas de classificação de texto podem ser compostos por quatro níveis de escopo. São eles:
Para resolver problemas não linearmente separáveis utilizando RNAs, a alternativa mais empregada é adicionar uma ou mais camadas intermediárias. Uma rede com uma camada intermediária pode implementar qualquer função contínua. A partir de duas camadas intermediárias, é possível aproximar qualquer função, desde que sejam utilizados neurônios suficientes.
Sobre as redes Perceptron de múltiplas camadas (MLP, do inglês Multilayer Percetron), é correto afirmar:
- Uma rede é completamente conectada quando os neurônios da rede estão conectados a todos os neurônios da camada anterior e/ou seguinte.
- A taxa de aprendizado no treinamento da rede representa o quanto a rede já aprendeu e, por isso, valores altos fazem com que as variações dos pesos sejam menores.
- Utilizam nas camadas intermediárias funções de ativação não lineares.
Selecione a alternativa correta:
Com o crescimento acelerado de mídias sociais, os usuários podem expressar suas ideais e opiniões por fóruns, tweets, sites para avaliação de produtos, vídeos, posts etc. Nesse contexto, técnicas de classificação são utilizadas para classificar essas opiniões em, por exemplo, positiva, negativa ou neutra. Esse tipo de aplicação é conhecido por:
A filtragem de informações refere-se à seleção da informação relevante e à retirada de informações irrelevantes a partir de um fluxo de dados recebidos. Uma aplicação prática dessa filtragem de informações é:
Uma das principais vantagens das redes neurais profundas (RNPs) é que elas podem aprender a extrair características relevantes a partir de dados. Existem, inclusive, RNPs voltadas exclusivamente para extração de características, por exemplo:
Técnicas de aprendizado de máquina são amplamente utilizadas em classificação de textos. São exemplos de técnicas de classificação:
Semana 7 5
O objetivo da similaridade textual consiste em verificar o quão “próximos” são dois fragmentos de texto a partir ____________ (lacuna 1) e de ____________ (lacuna 2), em que o primeiro se refere à similaridade ____________ (lacuna 3), e a segunda à similaridade ____________ (lacuna 4).
Selecione a alternativa que representa os conteúdos adequados para preencher as lacunas do texto acima:
Considere as seguintes matrizes de confusão representando a avaliação de dois classificadores de sentimentos C1 e C2, respectivamente:
C1 | ||
Previsto | Verdadeiro | |
Positivo | Negativo | |
Positivo | 40 | 30 |
Negativo | 10 | 20 |
C2 | ||
Previsto | Verdadeiro | |
Positivo | Negativo | |
Positivo | 25 | 40 |
Negativo | 25 | 10 |
A partir das avaliações, qual classificador (C1 ou C2) você escolheria? Selecione a alternativa correta:
Considere um minerador de emoções, no qual, em um documento analisado, a avaliação “Bom atendimento” aparece 5 vezes, “Agilidade” 3 vezes, e “Qualidade” 1 vez.
As taxas de frequência (TF) normalizadas para “Bom atendimento”, “Agilidade” e “Qualidade”, respectivamente, são:
Em uma ontologia, as relações semânticas representam um tipo de relação entre as palavras e os significados. A relação de parte entre duas palavras, ou seja, uma relação “é parte de” é o tipo de relação denominada:
A classificação de sentimentos a partir de textos é uma das principais aplicações de análise de sentimentos. Considerando o conjunto de dados a seguir, com informações de 8 (oito) textos, qual atributo preditivo (feature, característica) você escolheria para determinar, de forma mais precisa, o sentimento? Se julgar necessário, pode utilizar a equação de Bayes para tomar a decisão.
ID | #AVALIAÇÕES | CATEGORIA | TEM PAIS VIVOS | SENTIMENTO |
1 | MÉDIA | ESPORTE | SIM | POSITIVO |
2 | BAIXA | POLICIAL | NÃO | NEGATIVO |
3 | ALTA | MODA | NÃO | POSITIVO |
4 | MÉDIA | ESPORTE | NÃO | POSITIVO |
5 | MÉDIA | POLICIAL | SIM | NEGATIVO |
6 | ALTA | POLICIAL | NÃO | NEGATIVO |
7 | BAIXA | ESPORTE | SIM | POSITIVO |
8 | BAIXA | POLICIAL | SIM | NEGATIVO |