Geral

Redes Neurais

Semana 1 5

#1

Os três principais paradigmas de aprendizagem em redes neurais incluem aprendizado supervisionado, aprendizado não supervisionado e aprendizado por reforço. Cada paradigma tem características específicas e é adequado para diferentes tipos de problemas e contextos. 

Considerando as características e aplicações de cada paradigma, assinale a alternativa que corretamente categoriza uma vantagem e uma desvantagem de cada um dos três paradigmas de aprendizagem em redes neurais:

A
Aprendizado supervisionado: Vantagem - Não requer dados rotulados; Desvantagem - Apresenta baixa precisão. / Aprendizado não supervisionado: Vantagem - Alta precisão com dados rotulados; Desvantagem - Tem dificuldade em encontrar padrões ocultos. / Aprendizado por reforço: Vantagem - Tempo de treinamento curto; Desvantagem - Alto grau de dificuldade para implementação.
B
Aprendizado supervisionado: Vantagem - Não requer dados rotulados; Desvantagem - Tempo de treinamento prolongado. / Aprendizado não supervisionado: Vantagem - Eficiência em decisões sequenciais; Desvantagem - Resultados menos interpretáveis. / Aprendizado por reforço: Vantagem - Alta precisão com dados rotulados; Desvantagem - Necessidade de grande quantidade de dados rotulados.
C
Aprendizado supervisionado: Vantagem - Alta precisão com dados rotulados; Desvantagem - Necessidade de grande quantidade de dados rotulados. / Aprendizado não supervisionado: Vantagem - Capacidade de encontrar padrões ocultos; Desvantagem - Resultados menos interpretáveis. / Aprendizado por reforço: Vantagem - Eficiência em decisões sequenciais; Desvantagem - Tempo de treinamento prolongado.
D
Aprendizado supervisionado: Vantagem - Capacidade de encontrar padrões ocultos; Desvantagem - Resultados menos interpretáveis. / Aprendizado não supervisionado: Vantagem - Alta precisão com dados rotulados; Desvantagem - Necessidade de grande quantidade de dados rotulados. / Aprendizado por reforço: Vantagem - Treinamento rápido; Desvantagem - Baixa precisão.
E
Aprendizado supervisionado: Vantagem - Treinamento rápido; Desvantagem - Necessidade de grande quantidade de dados rotulados. / Aprendizado não supervisionado: Vantagem - Alta precisão; Desvantagem - Não encontra padrões ocultos. / Aprendizado por reforço: Vantagem - Eficiência em decisões sequenciais; Desvantagem - Tempo de treinamento prolongado.
#2

O neurônio biológico possui componentes específicos que desempenham funções essenciais para a transmissão de sinais. Esses componentes incluem os dendritos, o soma e o axônio, cada um com uma função distinta. Compreender como esses componentes operam é crucial para a modelagem matemática usada no desenvolvimento das redes neurais artificiais. Essa modelagem permite que redes neurais artificiais executem tarefas complexas de maneira eficiente, inspirando-se no funcionamento dos neurônios biológicos.

A estrutura do neurônio biológico é representada na modelagem matemática utilizada em redes neurais artificiais. Assinale a alternativa que descreve corretamente um possível representação.

A
O axônio é modelado como uma função sigmoide, e os dendritos como funções lineares ponderadas.
B
Os dendritos são modelados como funções de saída, e o soma como um multiplicador de sinais.
C
As sinapses dendritos) são modeladas como entradas ponderadas, e o soma como uma função que tem as  entradas como operandos.
D
As sinapses (dendritos) são modeladas como funções de ativação, e o soma como um somador simples.
E
O soma é modelado como um gerador de sinais elétricos, e o axônio como um receptor de sinais.
#3

O neurônio artificial representa a unidade de processamento em uma rede neural. Sua modelagem matemática tem como base a estrutura e funcionamento do neurônio biológico. Considerando os elementos básicos do neurônio artificial e o seu funcionamento, é correto afirmar que: 

A

a função de ativação tem como objetivo restringir a amplitude de saída do neurônio artificial e pode assumir diversas formas, lineares e não-lineares.

B

o corpo celular do neurônio matemático é representado por um combinador não-linear das entradas e seus respectivos pesos.

C

o neurônio artificial utilizado em redes neurais consiste numa modelagem matemática quantitativa do neurônio biológico.

D

o neurônio artificial é modelado a partir de um processo determinístico, ou seja, para uma mesma entrada, ele sempre responderá da mesma forma.

E

os pesos dos neurônios artificiais podem assumir apenas valores positivos, representando a presença ou ausência de sinais de entrada.

#4

O neurônio biológico possui componentes específicos que desempenham funções essenciais para a transmissão de sinais. Esses componentes incluem os dendritos, o soma e o axônio, cada um com uma função distinta. Compreender como esses componentes operam é crucial para a modelagem matemática usada no desenvolvimento das redes neurais artificiais. Essa modelagem permite que redes neurais artificiais executem tarefas complexas de maneira eficiente, inspirando-se no funcionamento dos neurônios biológicos.
A estrutura do neurônio biológico é representada na modelagem matemática utilizada em redes neurais artificiais. Assinale a alternativa que descreve corretamente um possível representação.

A

Os dendritos são modelados como funções de saída, e o soma como um multiplicador de sinais.

B

As sinapses (dendritos) são modeladas como funções de ativação, e o soma como um somador simples.

C

O axônio é modelado como uma função sigmoide, e os dendritos como funções lineares ponderadas.

D

As sinapses dendritos) são modeladas como entradas ponderadas, e o soma como uma função que tem as  entradas como operandos.

E

O soma é modelado como um gerador de sinais elétricos, e o axônio como um receptor de sinais.

#5

Os três principais paradigmas de aprendizagem em redes neurais são: aprendizado supervisionado, aprendizado não supervisionado e aprendizado por reforço. Cada paradigma possui características específicas e é adequado para diferentes tipos de problemas e contextos. 

Considerando as características e aplicações mencionadas, assinale a alternativa que descreve corretamente os três paradigmas de aprendizagem em redes neurais.

A
O aprendizado supervisionado utiliza dados rotulados para treinar a rede, e o não supervisionado utiliza dados não rotulados para descobrir padrões ocultos, e o aprendizado por reforço utiliza um agente que aprende por meio de recompensas e penalidades.
B
O aprendizado supervisionado utiliza dados rotulados e não rotulados, o aprendizado não supervisionado utiliza apenas dados rotulados, e o aprendizado por reforço utiliza uma combinação de dados rotulados e não rotulados para aprender.
C
O aprendizado supervisionado utiliza dados rotulados para treinar a rede, o aprendizado não supervisionado utiliza dados rotulados para descobrir padrões ocultos, e o aprendizado por reforço utiliza um agente que aprende por meio de tentativa e erro.
D
O aprendizado supervisionado utiliza dados não rotulados para treinar a rede, o aprendizado não supervisionado utiliza dados rotulados para descobrir padrões ocultos, e o aprendizado por reforço utiliza um agente que aprende por meio de tentativa e erro.
E
O aprendizado supervisionado utiliza recompensas e penalidades para treinar a rede, e o não supervisionado utiliza dados rotulados para descobrir padrões ocultos, e o aprendizado por reforço utiliza dados não rotulados para aprender por meio de tentativa e erro.

Semana 2 4

#1

Leia o trecho:

A divisão dos dados em diferentes conjuntos é um passo fundamental na preparação para o treinamento de redes neurais. Normalmente, os dados são divididos em três conjuntos:  [preencher 1], que é utilizado para treinar o modelo;  [preencher 2] , que é usado para ajustar os hiperparâmetros e evitar overfitting; e [preencher 3], que serve para avaliar o desempenho final do modelo.

Os termos [preencher 1], [preencher 2] e [preencher 3] são corretamente substituídos por:

A
1 - validação; 2 - treinamento; 3 - teste.
B
1 - treinamento; 2 - validação; 3 - teste.
C
1 - treinamento; 2 - teste; 3 - validação.
D
1 - validação; 2 - teste; 3 - treinamento.
E
1 - teste; 2 - treinamento; 3 - validação.
#2

Leia o trecho:

O Perceptron é um dos modelos mais simples e fundamentais de redes neurais artificiais. Este modelo consiste em uma única camada de neurônios que calcula uma função de ativação baseada na soma ponderada das entradas. Uma das principais limitações do Perceptron é que ele só consegue resolver problemas que são [preencher 1]. Para treinar um Perceptron, o novo peso receberá um incremento que [preencher 2]  erro cometido.

Os termos [preencher 1] e [preencher 2] são corretamente substituídos por:

A
1 - linearmente separáveis; 2 - é o valor do.
B
1 - linearmente separáveis; 2 - é  proporcional ao.
C
1 - não linearmente separáveis; 2 - leva ao aumento do.
D
1 - não linearmente separáveis; 2 - corresponde à retropropagação do.
E
1 - linearmente separáveis; 2 - independe do.
#3

A preparação adequada dos dados é um aspecto crítico no processo de treinamento de modelos de inteligência artificial, especialmente de redes neurais. Este processo envolve diversas técnicas destinadas a otimizar tanto a precisão quanto a eficiência dos algoritmos de aprendizado. Dentre estas técnicas, a normalização é uma das mais relevantes, pois equaliza a influência de cada característica no modelo, prevenindo que variáveis com escalas amplas impactem negativamente a performance do algoritmo. Tal prática é importante para manter a consistência dos dados e para acelerar o processo de aprendizado ao facilitar o caminho do gradiente na busca pelo mínimo global da função de perda.

Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas:

I. A normalização dos dados é um passo essencial na preparação dos dados para redes neurais, pois ajusta os valores das características para um intervalo comum.

PORQUE

II. A normalização ajuda a evitar que características com valores maiores dominem o aprendizado e melhora a convergência do modelo durante o treinamento.

A respeito dessas asserções, assinale a alternativa correta:

A
As asserções I e II são falsas.
B
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
C
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
D
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
E
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
#4

Leia o trecho:

O modelo Adaline (Adaptive Linear Neuron) é uma variação do Perceptron que utiliza uma função de ativação linear e uma regra de aprendizagem baseada no gradiente descendente. Diferente do Perceptron, usando-se o Adaline, o erro é calculado  [preencher 1]. No Adaline, o algoritmo de aprendizagem tem como objetivo minimizar o erro das saídas em relação aos valores desejados. A função de custo a ser minimizada considera [preencher 2].

Os termos [preencher 1] e [preencher 2] são corretamente substituídos por:

A
1 - antes do sinal de entrada; 2 - os erros médios.
B
1 - considerando-se o aprendizado não supervisionado; 2 - os erros absolutos.
C
1 - antes da função de ativação; 2 -a soma dos erros quadráticos.
D
1 - considerando-se o aprendizado não supervisionado; 2 - a soma da média dos erros.
E
1 - considerando-se o aprendizado supervisionado; 2 - a derivada da função da energia do erro.

Semana 3 7

#1

As funções de ativação não lineares são fundamentais para o funcionamento das redes neurais, permitindo que elas aprendam e representem relações complexas. A função sigmoide é uma dessas funções, amplamente utilizada devido às suas propriedades específicas. Compreender como a função sigmoide opera e suas vantagens e desvantagens é essencial para o design eficaz de redes neurais.

Nesse sentido, assinale a alternativa que descreve corretamente a função sigmoide e explica como essa função influencia o aprendizado e a performance das redes neurais:

A
A função sigmoide mapeia valores reais para o intervalo (0, 1), útil para representar estados de ativação. Sua derivada pode ser muito pequena em valores extremos.
B
A função sigmoide mapeia valores reais para o intervalo (-1, 1) e é simétrica em torno da origem.
C
A função sigmoide transforma os valores de saída em probabilidades, distribuindo-os de forma que a soma seja igual a 1.
D
A função sigmoide mapeia valores negativos para zero e mantém os valores positivos, resolvendo o problema do desaparecimento do gradiente.
E
A função sigmoide é uma função linear que transforma valores de entrada em saídas diretamente proporcionais.
#2

Durante o desenvolvimento de uma rede neural, é comum utilizar um dataset específico para treinamento, amplamente reconhecido por sua simplicidade e estrutura balanceada. No exemplo de classificação de tipos orquídeas (Setosa, Virginica e Versicolor), esse dataset contém as três classes de flores com igual número de exemplos para cada classe, facilitando o aprendizado dos conceitos básicos de aprendizado de máquina.

Com base nisso, assinale alternativa que apresenta o dataset utilizado para o treinamento da rede neural:

A
O dataset COCO.
B
O dataset Iris.
C
O dataset ImageNet.
D
O dataset MNIST.
E
O dataset CIFAR-10.
#3

A avaliação de desempenho de redes neurais é fundamental para garantir que o modelo aprenda corretamente e generalize bem para novos dados. Durante a videoaula, foram mostradas as curvas de erro de treinamento e validação ao longo das épocas.

Assinale a alternativa que interpreta corretamente uma queda contínua nas curvas de erro de treinamento e validação ao longo das épocas:

A
Indica que o modelo está sofrendo underfitting.
B
Indica que o modelo tem uma alta variância.
C
Indica que o modelo está aprendendo adequadamente.
D
Indica que o modelo está sofrendo overfitting.
E
Indica que o modelo tem um erro constante.
#4

No desenvolvimento de uma rede neural, a manipulação adequada dos dados é fundamental para o sucesso do treinamento. Uma abordagem específica é necessária para converter atributos categóricos em atributos numéricos, permitindo que as redes neurais possam processar os dados corretamente.

Considerando o exemplo de classificação de tipo de orquídeas (Setosa, Virginica e Versicolor), assinale a alternativa que apresenta a abordagem utilizada para converter os atributos categóricos do dataset Iris em atributos numéricos:

A
Utilização de PCA (Principal Component Analysis).
B
Utilização de One-Hot Encoding.
C
Utilização de Feature Scaling.
D
Utilização de Min-Max Scaling.
E
Utilização de Label Encoding.
#5

A rede neural de múltiplas camadas (MLP) é formada por uma camada de entrada, uma ou mais camadas ocultas e uma camada de saída. Cada neurônio em uma camada está conectado a todos os neurônios da próxima camada, permitindo a propagação das entradas por meio da rede. A arquitetura da MLP é essencial para resolver problemas complexos que não podem ser solucionados por modelos lineares simples.

Nesse sentido, assinale a alternativa que descreve corretamente a função da camada oculta em uma rede neural de múltiplas camadas:

A
A camada oculta não tem função significativa no aprendizado da rede neural, apenas transmite sinais.
B
A camada oculta transforma o problema original em um espaço de representação diferente.
C
A camada oculta é responsável por fornecer a saída final da rede ao final do processamento.
D
A camada oculta realiza operações de entrada e saída sem alterar os dados originais, mantendo-os intactos.
E
A camada oculta é utilizada apenas para aumentar o tempo de processamento da rede neural.
#6

As funções de ativação não lineares são essenciais para o desempenho das redes neurais de múltiplas camadas (MLPs). Elas permitem que a rede aprenda e represente relações complexas que não poderiam ser capturadas por funções lineares simples. Uma dessas funções de ativação é a ReLU (Rectified Linear Unit), que é amplamente utilizada devido às suas vantagens específicas.

Logo, assinale a alternativa que descreve corretamente uma das vantagens da função de ativação ReLU e explica como essa função contribui para a eficiência do treinamento em redes neurais profundas:

A
A função ReLU mapeia valores reais para o intervalo ( - 1,1)  e é contínua, o que permite representar estados intermediários de ativação dos neurônios.
B
A função ReLU é uma função linear que transforma valores de entrada em saídas diretamente proporcionais.
C
A função ReLU é utilizada apenas em redes neurais convolucionais devido à sua simplicidade.
D
A função ReLU mantém os valores positivos inalterados, mapeando os valores negativos para zero.
E
A função ReLU transforma os valores de saída em probabilidades, distribuindo-os de forma que a soma seja igual a 1.
#7

As funções de ativação desempenham um papel importante no desempenho das redes neurais de múltiplas camadas. Elas são responsáveis por introduzir a não linearidade no modelo, permitindo que a rede aprenda e represente funções complexas. Existem várias funções de ativação utilizadas em redes neurais, cada uma com características e aplicações específicas.

Assinale a alternativa que descreve características da função de ativação sigmoide:

A
A função sigmoide mapeia valores reais para o intervalo ( - 1,1) e é usada principalmente para funções de classificação linear.
B
A função sigmoide mapeia valores reais para o intervalo  (0,1)  e é contínua, o que permite representar estados intermediários de ativação dos neurônios.
C
A função sigmoide é uma função linear que transforma valores de entrada em saídas diretamente proporcionais.
D
A função sigmoide é utilizada apenas em redes neurais convolucionais devido à sua simplicidade.
E
A função sigmoide mapeia valores reais para o intervalo  ( - 1,1)  e é simétrica em torno da origem.

Semana 4 5

#1

Para resolver problemas do mundo real com redes neurais, normalmente é necessário usar redes de tamanho grande e altamente estruturadas. Ainda assim, uma questão prática é minimizar o tamanho da rede mantendo bom desempenho. Um dos textos-base da semana apresenta duas maneiras de garantir um bom desempenho usando-se uma rede MLP (perceptron de múltiplas camadas) minimizada: pelo crescimento da rede ou pela poda da rede.  Sobre as técnicas de poda de rede, assinale a alternativa correta. 

A
A poda da rede começa com uma rede  perceptron de múltiplas camadas grande com desempenho adequado, da qual passam a ser eliminados ou reduzidos pesos sinápticos de forma seletiva e ordenada.
B
A poda da rede não é usada para melhorar a generalização da rede neural.
C
A poda da rede é uma forma de aumentar a complexidade e a capacidade da rede neural.
D
A poda da rede regula o número de neurônios  na presença de um alto erro de treinamento.
E
A poda da rede envolve adicionar novos neurônios e camadas, retirando neurônios e camadas de menor desempenho.
#2

A validação cruzada é uma técnica utilizada para mensurar e ajudar a aumentar o desempenho de um modelo de aprendizado de máquina, possibilitando que o  modelo generalize melhor para novos dados. Suponha que após o desenvolvimento da rede,  você inicie o  treinamento da rede e sua validação, utilizando a validação cruzada, com o objetivo de  reduzir a chance de uma divisão inadequada entre dados de treino e de validação.
Assinale a alternativa que melhor descreve a técnica de validação cruzada. 

A
Na primeira fase, utilizar três conjuntos de dados totalmente diferentes: um para desenvolvimento, outro para treinamento e outro para avaliação. Nas fases posteriores, alternar o uso dos três conjuntos de dados.
B
Dividir o conjunto de dados em duas partes: uma para treinamento e outra para teste, e utilizar essa divisão para avaliar o modelo em um número de vezes definidos por uma constante proporcional ao tamanho do conjunto de dados.
C
Dividir o conjunto de dados em duas partes: 3/4 dos dados serão usados para treinamento e 1/4 dos dados para a validação. O processo de treinamento e validação é realizado apenas uma vez.
D
Dividir o conjunto de dados em n subconjuntos (ou folds). O processo de treino e validação é executado n vezes. Fazendo i variar de 1 a n, a cada execução o subconjunto i será usado para validação, e os demais para treino.
E
Treinar o modelo várias vezes com diferentes taxas de aprendizagem e diferentes conjuntos de dados, possibilitando a escolha da configuração com o melhor desempenho.
#3

O subajuste (underfitting) e o sobreajuste (overfitting) podem ocorrer no treinamento de redes de Perceptron Multicamadas (MLP). Quando ocorre o sobreajuste (overfitting),  a rede aprende muito bem os dados de treinamento, mas falha em generalizar para novos dados.
Suponha que você está treinando uma rede MLP e percebe que o desempenho da rede no conjunto de dados de validação é significativamente inferior ao desempenho no conjunto de dados de treinamento.

Assinale a alternativa que demonstra uma técnica que pode melhorar a aprendizagem de tal rede. 

A
Aumentar a taxa de aprendizagem para melhorar a generalização e reduzir o tempo de treinamento.
B
Reduzir o número de camadas escondidas para simplificar o modelo, tornando-o menos complexo.
C
Aumentar o número de neurônios em cada camada escondida para melhorar o aprendizado.
D
Implementar a regularização L2, estabelecendo um limite para os pesos, evitando super especialização ou saturação sináptica.
E
Diminuir o tamanho do conjunto de dados de treinamento para reduzir o sobreajuste e melhorar a eficiência.
#4

A configuração de uma rede MLP requer atenção especial a diversos componentes. Primeiramente, é necessário definir o número de [preencher 1] na rede, o que influencia diretamente na capacidade de aprendizado. Além disso, ajustar o número de [preencher 2] em cada camada ajuda a moldar a estrutura da rede para resolver problemas específicos.

Os termos [preencher 1] e [preencher 2] são corretamente substituídos por:

A
1 camadas - 2 sinapses
B
1 neurônios - 2 camadas
C
1 camadas - 2 neurônios
D
1 saídas - 2 entradas
E
1 sinapses - 2 entradas
#5

Os hiperparâmetros:- número de camadas escondidas e - número de neurônios por camada são fundamentais para o desempenho de uma rede Perceptron Multicamadas (MLP). Ajustar esses hiperparâmetros de forma adequada pode melhorar significativamente a capacidade da rede de aprender e generalizar a partir dos dados de treinamento. Uma configuração inadequada pode resultar em subajuste ou sobreajuste, afetando a eficácia do modelo. Considere que um técnico esteja desenvolvendo uma rede MLP para solução de um problema específico. Tal rede apresenta subajuste durante o treinamento. Uma vez que há um número suficiente de dados de treinamento, o técnico concluiu que a rede não está conseguindo capturar padrões suficientes dos dados de treinamento. 

Assinale a alternativa que traz a ação mais adequada para melhorar o desempenho da rede neste caso. 

A
Reduzir a taxa de aprendizagem para evitar oscilações durante o processo de treinamento.
B
Aumentar o número de neurônios em cada camada escondida para aumentar a capacidade de aprendizado da rede.
C
Reduzir o número de camadas escondidas para simplificar o modelo e facilitar o aprendizado.
D
Aumentar a taxa de aprendizagem para que a rede aprenda mais rapidamente.
E
Diminuir o tamanho do conjunto de dados de treinamento para facilitar o aprendizado da rede.

Semana 5 9

#1

A rede SOM (Self-Organizing Maps) é uma técnica de aprendizado não supervisionado utilizada para mapear dados de alta dimensão em um espaço de menor dimensão, geralmente bidimensional, preservando a topologia dos dados. Este mapeamento facilita a visualização e análise de dados complexos.


Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas:

I. Na fase de competição, o objetivo é identificar o neurônio vencedor (BMU, do inglês best match unit) calculando a distância euclidiana entre o vetor de entrada e os vetores de pesos dos neurônios.

PORQUE

II. A função de vizinhança, utilizada na fase de cooperação, determina a magnitude da atualização dos pesos dos neurônios vizinhos ao vencedor com base em uma função gaussiana.

A respeito dessas asserções assinale a alternativa correta.

A
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
B
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
C
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
D
As asserções I e II são falsas.
E
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
#2

A rede SOM (do inglês, Self Organizing Maps ou Mapas auto-organizáveis) faz treinamento de dados para classificar e reconhecer padrões presentes no espaço de dados de entrada. Por se tratar de uma técnica não-supervisionada, não podemos avaliar o resultado da rede SOM utilizando medidas como a acurácia, usada nos casos
supervisionados. Para isso, outras medidas de qualidade e outras abordagens
podem ser utilizadas.Por exemplo, o Erro de Quantização que tem a finalidade de avaliar o mapa gerado pelo treinamento.

Assinale a alternativa que define resumidamente o conceito de Erro de Quantização:

A
O Erro de Quantização é a diferença entre os valores reais e preditos.
B
O Erro de Quantização é a medida que avalia se neurônios próximos no grid representam padrões similares.
C
O Erro de Quantização é a soma das distâncias entre todos os neurônios de uma rede SOM.
D
O Erro de Quantização avalia a distância média entre os exemplos do conjunto de treinamento e seus respectivos neurônios representantes na rede.
E
O Erro de Quantização mede a precisão dos rótulos predefinidos dos dados de entrada na rede SOM.
#3

O aprendizado não supervisionado pode ocorrer mediante dois tipos de algoritmos de treinamento: aprendizado competitivo e aprendizado hebbiano. O aprendizado competitivo é aplicado em diversas áreas, como reconhecimento de padrões, análise de clusters e visualização de dados. Um exemplo de rede que utiliza o aprendizado competitivo é a rede SOM. A estratégia mais simples para a definição de quem ganhará a competição é denominada de "the winner takes all".



Assinale a alternativa que defina resumidamente a estratégia "the winner takes all".

A
Os neurônios competem para representar um padrão de entrada. Um grupo de neurônios definido pela vizinhança gaussiana representa o estado de "vencedor".
B
Os neurônios competem para representar um padrão de entrada. Após a determinação dos vencedores, nenhum neurônio será inibido, todos serão usados para o treinamento da rede.
C
Os neurônios competem para representar um padrão de entrada. Comparado à entrada, o neurônio com maior similariedade ou menor distância é apontado como o neurônio vencedor, inibindo os demais neurônios.
D
Os neurônios competem para representar um padrão de entrada. O vencedor é definido com o uso de rótulos predefinidos para identificar padrões nos dados de entrada.
E
Os neurônios competem para representar um padrão de entrada. Após a determinação dos vencedores, é definido o número de câmadas e de neurônios que formarão a rede.
#4

As redes MLP (Multi-Layer Perceptron) são uma arquitetura de rede neural artificial amplamente utilizada em aprendizado de máquina. Com suas múltiplas camadas ocultas e a utilização de produtos internos e funções de ativação, as MLPs são capazes de aprender e representar padrões complexos nos dados.



De acordo com o apresentado, assinale a alternativa que define os principais conceitos e características das redes MLP.

A
As redes MLP utilizam o produto interno entre o vetor de entradas e os pesos dos neurônios para processar sinais.
B
As redes MLP são mais eficientes em interpolação de dados comparadas a outras redes neurais.
C
As redes MLP utilizam uma única camada oculta, o que limita sua capacidade de aprendizagem.
D
As redes MLP requerem uma matemática mais complexa para construir funções complexas em comparação com outras redes
neurais.
E
As redes MLP são idênticas às redes RBF em termos de estrutura e processo de treinamento, diferindo apenas na aplicação.
#5

Os modelos de mapeamento de características, como os desenvolvidos por Willshaw-von der Malsburg e Kohonen, são fundamentais no campo das redes neurais de aprendizado não supervisionado. Esses modelos ajudam a entender como determinadas  redes neurais podem ser organizadas e treinadas.

Com relação a este contexto, analise as asserções a seguir e a relação proposta entre elas:

I. No modelo de Willshaw-von der Malsburg fundamental são usadas duas grades bidimensionais de neurônios conectadas entre si: uma que representa os neurônios de entrada; e  outra que representa os neurônios pós-sinapticos/de saída. A grade pós-sinaptica utiliza um mecanismo excitatório de curto alcance e  e um mecanismo inibitório de longo alcance, importantes para a auto-organização.

PORQUE

II. No modelo de Kohonen, o aprendizado se dá por meio da retropropagação, sendo calculada a média móvel dos gradientes para cada peso ao longo do treinamento.

A respeito dessas asserções assinale a alternativa correta:

A
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
B
As asserções I e II são falsas.
C
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
D
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
E
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
#6

O processo cooperativo nas redes SOM (Self-Organizing Maps) é fundamental para o aprendizado não supervisionado, permitindo que os neurônios vencedores e seus vizinhos se ajustem de maneira organizada e topologicamente preservada. Essa abordagem garante que os neurônios próximos ao neurônio vencedor sejam mais influenciados e ajustados.

De acordo com o apresentado, assinale a alternativa que apresenta como a vizinhança topológica é definida para os neurônios cooperativos.

A
A vizinhança topológica é invariante à distância lateral e considera apenas a intensidade de excitação dos neurônios.
B
A vizinhança topológica é uma função exponencial que aumenta com a distância lateral, permitindo maior adaptação dos neurônios mais distantes.
C
A vizinhança topológica é uma função gaussiana que decresce suavemente com a distância lateral entre neurônios, alcançando seu valor máximo no neurônio vencedor.
D
A vizinhança topológica é uma função constante, onde todos os neurônios recebem a mesma atualização independentemente da distância lateral.
E
A vizinhança topológica é definida como uma função linear que diminui uniformemente com a distância lateral entre neurônios.
#7

A rede SOM é uma ferramenta poderosa para a visualização e clusterização de dados multidimensionais, amplamente utilizada em aprendizado de máquina. Com uma configuração adequada e análise cuidadosa dos resultados, é possível obter insights valiosos sobre os dados.

Com base nos assuntos estudados sobre a aplicação da rede SOM ao problema de agrupamento de dados, observe as afirmativas a seguir:

I. A rede SOM (Self-Organizing Map) é utilizada para criar uma representação
ordenada de dados multidimensionais que simplifica a complexidade e revela relações significativas.

II. O dataset Iris, amplamente utilizado em estudos de aprendizado de máquina, é composto por quatro atributos descritivos de flores e três classes distintas, facilitando a visualização dos resultados de clusterização.

III. A configuração da rede SOM envolve parâmetros críticos como a dimensionalidade do grid, sigma (que define o tamanho da vizinhança), função de distância, taxa de aprendizado e semente aleatória, que influenciam diretamente a qualidade do mapeamento.

IV. A rede SOM requer supervisionamento constante durante o treinamento para garantir a correta formação dos clusters.

Está correto o que se afirma em:

A
I e II, apenas.
B
II e IV, apenas.
C
I, III e IV, apenas.
D
I, II e III, apenas.
E
I, II e IV, apenas.
#8

A análise de redes SOM (Self-Organizing Maps) é crucial para identificar padrões e estruturas dentro dos dados. A U-Matrix é uma ferramenta valiosa nesse processo, auxiliando na visualização e compreensão dos agrupamentos formados pela rede. Entender como identificar macro-clusters dentro de um mapa SOM pode melhorar significativamente a interpretação dos dados, facilitando a extração de informações relevantes.


De acordo com o apresentado, assinale a alternativa que explique como a U-Matrix pode ser utilizada para identificar macro-clusters em um mapa SOM.

A
A U-Matrix avalia a similaridade de cada neurônio com seus vizinhos, identificando regiões homogêneas e heterogêneas, para encontrar fronteiras entre agrupamentos.
B
A U-Matrix utiliza a distância Euclidiana para medir a diferença entre os neurônios centrais e os de borda.
C
A U-Matrix ignora os neurônios vizinhos e se concentra apenas nos valores dos neurônios centrais.
D
A U-Matrix determina a formação de clusters comparando os valores dos neurônios centrais com uma constante pré-definida.
E
A U-Matrix calcula a média dos pesos dos neurônios em todo o grid para determinar a formação de clusters.
#9

A compreensão sobre a  operação de uma rede RBF pode melhorar quando a estudamos como um classificador de padrões, mediante a análise da separabilidade de padrões.

Assinale a alternativa que apresenta resumidamente como se dá a separabilidade de padrões em redes RBF.

A
A separabilidade de padrões em redes RBF é garantida pela presença de múltiplas camadas ocultas com neurônios profundamente conectados.
B
A separabilidade de padrões em redes RBF se dá pela existência de uma superfície que separa naturalmente os pontos da classe X1 dos pontos da classe X2.
C
A separabilidade de padrões em redes RBF se dá pela conexão direta entre as camadas de entrada e saída, sem necessidade de funções ocultas.
D
A separabilidade de padrões em redes RBF se dá pela utilização de funções de ativação não-lineares como ReLU e sigmoide.
E
A separabilidade de padrões em redes RBF se dá unicamente pela estrutura dos dados de entrada, sem a necessidade de mapeamento para um espaço oculto.

Semana 6 7

#1

Os neurônios estocásticos são uma característica importante da máquina de Boltzmann. 

Assinale a alternativa que apresenta como os neurônios estocásticos operam na máquina de Boltzmann e qual o impacto dessa operação no comportamento da rede.

A
Os neurônios estocásticos operam com base em probabilidades, permitindo que a rede de Boltzmann explore diferentes estados de energia.
B
Os neurônios estocásticos operam de forma determinística, ajustando seus estados para minimizar a energia global da rede.
C
Os neurônios estocásticos são responsáveis por manter a temperatura da rede constante durante o processo de aprendizado.
D
Os neurônios estocásticos impedem que a rede de Boltzmann atinja o equilíbrio térmico.
E
Os neurônios estocásticos aumentam a energia da rede a cada iteração, dificultando a convergência para um estado de baixa energia.
#2

O algoritmo de divergência contrastiva é um método eficiente utilizado no treinamento das máquinas restritas de Boltzmann (RBMs). Este algoritmo ajusta os pesos da rede de forma a aproximar o equilíbrio térmico, minimizando a energia dos estados desejados e maximizando a energia dos estados indesejados. A aplicação correta deste algoritmo é fundamental para o desempenho eficaz das RBMs.



Explique como o algoritmo de divergência contrastiva contribui para o treinamento das máquinas restritas de Boltzmann.

A
O algoritmo de divergência contrastiva impede que a RBM atinja o equilíbrio térmico, limitando sua aplicação em problemas complexos.
B
O algoritmo de divergência contrastiva elimina a necessidade de calcular a energia dos estados indesejados, focando apenas nos estados desejados.
C
O algoritmo de divergência contrastiva permite ajustar os pesos da RBM em poucos passos, aproximando o equilíbrio térmico sem a necessidade de longas simulações.
D
O algoritmo de divergência contrastiva utiliza um processo determinístico para ajustar os pesos dos neurônios, garantindo maior precisão.
E
O algoritmo de divergência contrastiva aumenta a quantidade de memória que a RBM pode armazenar, mas reduz a velocidade de treinamento.
#3

As redes de Hopfield possuem características específicas e algumas limitações que impactam seu uso prático. Uma característica importante é a simetria dos pesos das conexões entre neurônios, e uma limitação significativa é a capacidade limitada de armazenamento de memórias.



Determine qual característica ou limitação das redes de Hopfield é corretamente identificada na alternativa.

A
A simetria dos pesos nas redes de Hopfield permite que cada neurônio esteja conectado a si mesmo.
B
A simetria dos pesos nas redes de Hopfield impede que a rede converja para pontos fixos.
C
A capacidade de armazenamento das redes de Hopfield pode atingir o valor de aproximadamente 14% do número total de neurônios na rede.
D
A quantidade de memórias que podem ser armazenadas nas redes de Hopfield é ilimitada devido à sua estrutura.
E
As redes de Hopfield podem ajustar seus pesos dinamicamente durante a recuperação de memórias.
#4

A divergência construtiva de múltiplos passos é uma técnica que pode ser utilizada para melhorar o treinamento das máquinas restritas de Boltzmann (RBMs). 

Avalie como a divergência construtiva de múltiplos passos melhora o treinamento das RBMs em comparação com a divergência construtiva de um passo.

A
A divergência construtiva de múltiplos passos permite uma melhor aproximação do equilíbrio térmico, ajustando os pesos de maneira mais precisa em comparação com a divergência construtiva de um passo.
B
A divergência construtiva de múltiplos passos elimina a necessidade de calcular as correlações negativas durante o treinamento da RBM.
C
A divergência construtiva de múltiplos passos faz com que a RBM utilize um processo determinístico para ajustar os pesos dos neurônios, garantindo maior precisão.
D
A divergência construtiva de múltiplos passos impede que a RBM atinja o equilíbrio térmico, limitando sua aplicação em problemas complexos.
E
A divergência construtiva de múltiplos passos reduz a capacidade da RBM de armazenar padrões de dados complexos.
#5

As redes de Hopfield típicas pertencem à classe de redes neurais recorrentes, podendo ser usadas como memória associativa e  para resolver determinados problemas de otimização. 

Sobre as características das redes de Hopfield típicas, assinale a alternativa correta.

A
Possuem uma única camada, com pesos simétricos, o que garante que a função da energia decresça monotonamente enquanto são aplicadas as regras de ativação.
B
São uma forma de redes convolucionais, usadas amplamente em processamento de imagens.
C
Possuem uma arquitetura feedforward e são usadas principalmente em tarefas de classificação.
D
São compostas por múltiplas camadas de neurônios e utilizam funções de ativação não-lineares.
E
Funcionam com base em retropropagação e são adequadas para treinamento supervisionado.
#6

Os sistemas dinâmicos são utilizados para modelar o comportamento de sistemas que evoluem ao longo do tempo, podendo ser descritos por equações diferenciais ou de diferença. No caso das redes neurais, como a rede de Hopfield, os sistemas dinâmicos são utilizados para representar a evolução de estados do sistema até que ele alcance um ponto fixo.



Interprete como os sistemas dinâmicos contribuem para o funcionamento das redes neurais, especificamente na rede de Hopfield.

A
Os sistemas dinâmicos na rede de Hopfield são responsáveis pela criação de novos neurônios durante o treinamento.
B
Os sistemas dinâmicos são usados para aumentar a capacidade de memória das redes de Hopfield sem alterar os pesos das conexões.
C
Na rede de Hopfield, os sistemas dinâmicos servem para implementar algoritmos de aprendizado profundo.
D
Sistemas dinâmicos são utilizados para substituir o processo de ajuste de pesos nas redes de Hopfield.
E
Os sistemas dinâmicos permitem que as redes de Hopfield armazenem memórias associativas ao convergirem para pontos fixos.
#7

A rede de Hopfield é um tipo de rede neural recorrente que utiliza conceitos de sistemas dinâmicos para armazenar e recuperar memórias associativas. Este modelo foi proposto por John Hopfield em 1982 e utiliza princípios da física estatística, e dinâmica não linear.

Identifique a alternativa que melhor descreve como os sistemas dinâmicos são utilizados na rede de Hopfield.

A
Conceitos de sistemas dinâmicos são responsáveis, mediante o uso de pesos simétricos, pelo comportamento da função da energia, que  decresce monotonamente enquanto são aplicadas as regras de ativação.
B
Conceitos de sistemas dinâmicos são utilizados para ajustar a energia das conexões neuronais de forma contínua durante o treinamento
C
Conceitos de sistemas dinâmicos são responsáveis por gerar novos padrões de memória a cada ciclo de evolução, em um aprendizado não supervisionado.
D
Conceitos de sistemas dinâmicos são usados principalmente para a simulação da atividade de neurônios biológicos.
E
Conceitos de sistemas dinâmicos são usados com o objetivo principal de  eliminar memórias irrelevantes associadas aos padrões de entrada, garantindo que seja atingido um estado de equilíbrio.

Semana 7 5

#1

As Redes Neurais Recorrentes (RNNs) são especialmente úteis para modelar dados sequenciais, onde a ordem dos dados é crucial. Considere uma sequência de dados temporais, como séries temporais financeiras, sequências de texto ou dados de sensores. As RNNs processam esses dados mantendo informações ao longo da sequência, o que lhes permite capturar dependências temporais e contextuais nos dados.



Selecione a alternativa correta sobre o funcionamento das RNNs.

A
As RNNs não são capazes de processar séries temporais contínuas e precisam que os dados sejam discretizados previamente.
B
As RNNs processam dados sequenciais, mas cada passo no tempo é considerado independentemente dos outros.
C
As RNNs utilizam variáveis de estado para armazenar informações anteriores, o que permite que o modelo utilize o histórico da sequência.
D
As RNNs são eficazes apenas para dados de imagem e não são aplicáveis a dados textuais ou temporais.
E
As RNNs não conseguem lidar com a dependência temporal dos dados, necessitando de modelos adicionais para tal.
#2

Redes neurais recorrentes (RNNs) são uma poderosa ferramenta para modelagem de dados sequenciais. Elas são amplamente utilizadas em aplicações que envolvem dependências temporais, como, por exemplo, previsão de séries temporais. Uma característica distintiva das RNNs é sua capacidade de manter informações ao longo do tempo, o que as torna ideais para tarefas onde o contexto histórico é crucial. No entanto, essas redes também enfrentam o desafio do desaparecimento ou explosão de gradientes, especialmente em sequências longas, o que pode dificultar o aprendizado eficaz.





Selecione a alternativa que descreve corretamente uma aplicação prática que se beneficia das características das RNNs.

A
Compressão de imagens digitais utilizando técnicas de redução de dimensionalidade.
B
Análise de sentimentos em avaliações de produtos, baseando-se em palavras-chave específicas.
C
Processamento de imagens estáticas para segmentação e detecção de objetos.
D
Tradução automática de idiomas, capturando o contexto de frases inteiras para melhorar a precisão da tradução.
E
Previsão de demanda de produtos com base em dados históricos não sequenciais.
#3

Redes neurais recorrentes com memória de longo prazo, como as unidades LSTM (Long Short-Term Memory) e GRU (Gated Recurrent Units), foram desenvolvidas para resolver problemas comuns em redes recorrentes tradicionais, como o desaparecimento e a explosão de gradientes. 

Analise as seguintes alternativas e selecione a que descreve corretamente uma vantagem específica das unidades LSTM sobre as GRU.

A
Maior número de portas, permitindo um controle mais refinado do fluxo de informações e preservação de estados ao longo do tempo.
B
Exclusiva utilização para tarefas de processamento de linguagem natural, sem aplicação em outras áreas.
C
Menor número de parâmetros.
D
Capacidade de processar dados não sequenciais com a mesma eficácia que dados sequenciais.
E
Estrutura simplificada, facilitando o treinamento em conjuntos de dados menores e menos complexos.
#4

Redes neurais recorrentes são amplamente utilizadas para predição em séries temporais devido à sua capacidade de lidar com dados sequenciais e manter informações ao longo de muitos passos temporais. Nesta semana, foi discutido o exemplo prático do uso de redes densas (MLP) e redes recorrentes (LSTM) para prever séries temporais, incluindo a comparação de suas arquiteturas, processos de treinamento e eficácia na predição. 

Baseado na análise dos modelos discutidos, selecione a alternativa que melhor sintetiza a principal vantagem das redes LSTM em relação às redes densas (MLP) na predição de séries temporais.

A
Capacidade de manter e utilizar informações de longo prazo durante a predição, melhorando a precisão em séries temporais com padrões complexos.
B
Estrutura simplificada que facilita o treinamento em conjuntos de dados menores e menos complexos.
C
Exclusiva utilização para tarefas de processamento de linguagem natural, sem aplicação em outras áreas.
D
Capacidade de processar dados não sequenciais com a mesma eficácia que dados sequenciais.
E
Geralmente têm um menor número de parâmetros.
#5

Em redes neurais, diferentes arquiteturas podem ser  utilizadas para tarefas de predição de séries temporais, por exemplo, as  redes recorrentes LSTM. 

Selecione a alternativa que melhor descreve o impacto das características estruturais da LSTM na predição de séries temporais, considerando o exemplo prático apresentado nesta semana.

A
A estrutura da LSTM, com suas múltiplas portas de entrada, saída e esquecimento, permite um controle refinado do fluxo de informações, mantendo a precisão em sequências longas.
B
As LSTM são usadas exclusivamente para predição de séries temporais e não têm aplicação em outras áreas como reconhecimento de fala ou processamento de linguagem natural.
C
O menor número de hiperparâmetros na LSTM,  quando comparado ao número de hiperparâmetros da rede densa MLP, reduz a complexidade do modelo.
D
A simplicidade estrutural da LSTM facilita o treinamento em conjuntos de dados menores, sem a necessidade de muita memória computacional, nem de muito tempo de processamento, quando comparada à rede densa MLP.
E
A capacidade da LSTM de processar dados não sequenciais com alta eficácia faz dela a escolha ideal para uma variedade de aplicações de dados