Geral

Modelagem e Inferência Estatística

Semana 1 4

#1

Modelos lineares são ferramentas essenciais na análise de dados, especialmente quando a previsão envolve relações proporcionais entre variáveis. Porém, em muitos casos, o desafio está em interpretar corretamente os coeficientes e operar com eles em cenários variados. Isso exige domínio tanto da estrutura do modelo quanto das transformações numéricas envolvidas.

Um engenheiro de materiais está testando diferentes métodos de cura do concreto e aplica uma regressão linear simples com a equação:

Y=1800+1{,}3X

Onde Y é a resistência prevista em 28 dias (em PSI) e X é a resistência medida após o tratamento acelerado. Considerando dois lotes distintos, o primeiro com X=2500 e o segundo com X = 1900, a diferença entre os valores previstos para Y nos dois casos é de [preencher 1]. Já a média aritmética das previsões para esses dois lotes é de [preencher 2].

Com base na situação acima, identifique os termos [preencher 1] e [preencher 2] que são substituídos por:

A
1 – 780; 2 – 4660
B
1 – 750; 2 – 4640
C
1 – 820; 2 – 4700
D
1 – 800; 2 – 4680
E
1 – 700; 2 – 4600
#2

Um grupo de professores universitários realiza um estudo para investigar a relação entre o tempo de estudo semanal dos alunos, sua nota em uma disciplina pré-requisito e o número de faltas em uma disciplina. Eles querem verificar se esses fatores podem prever a nota final dos alunos. Para isso, os professores desenvolveram um modelo de regressão linear múltipla para prever o desempenho final com base nas variáveis independentes:

Nota final=10+1.7×(horas de estudo semanal)+0.5×(nota em pré-requisito)2.3×(número de faltas)+0.02×(horas de estudo semanal)×(nota em pré-requisito)0.1×(número de faltas)Nota final=10+1.7×(horas de estudo semanal)+0.5×(nota em pré-requisito)−2.3×(número de faltas)+0.02×(horas de estudo semanal)×(nota em pré-requisito)−0.1×(número de faltas)
\begin{aligned} \text{Nota final} &= 10 + 1.7 \times (\text{horas de estudo semanal}) \\ &\quad + 0.5 \times (\text{nota em pré-requisito}) \\ &\quad - 2.3 \times (\text{número de faltas}) \\ &\quad + 0.02 \times (\text{horas de estudo semanal}) \times (\text{nota em pré-requisito}) \\ &\quad - 0.1 \times (\text{número de faltas}) \end{aligned}

A

85,0

B

80,6

C

79,8

D

84,4

E

82,2

#3

Um engenheiro agrícola está analisando a relação entre a quantidade de água utilizada na irrigação (em litros por semana) e o crescimento das plantas (em centímetros) após um período de um mês. Os seguintes dados foram coletados de três experimentos: (3, 6), (5, 10), e (6, 12). O engenheiro precisa prever o crescimento esperado das plantas quando a quantidade de água utilizada na irrigação for de 7 litros por semana, utilizando a reta de ajuste linear obtida a partir dos dados.


Com base nos pontos (3, 6), (5, 10) e (6, 12), assinale a alternativa correta sobre qual será o valor estimado de Y (crescimento das plantas) quando x=7 (quantidade de água utilizada).

A
17
B
16
C
14.
D
15
E
13.
#4

Você está conduzindo um estudo para entender a relação entre a temperatura e as vendas de sorvetes. Durante o planejamento da análise, surge a dúvida entre o que é o modelo de regressão linear e a análise de correlação para explorar os dados. Cada método tem um propósito específico e é importante entender as diferenças entre eles.

Diante disso, assinale a alternativa que apresenta a principal diferença entre o modelo de regressão linear e análise de correlação.

A
A regressão linear e a análise de correlação são técnicas equivalentes.
B
A regressão linear mede a força da relação entre as variáveis, enquanto a análise de correlação busca prever valores da variável dependente.
C
O modelo de regressão linear busca prever valores da variável dependente, enquanto a análise de correlação busca medir a força da relação entre as variáveis.
D
A regressão linear é mais complexa que a análise de correlação.
E
A regressão linear utiliza uma reta para modelar a relação entre as variáveis, enquanto a análise de correlação utiliza um círculo.

Semana 2 15

#1

Em modelos de regressão linear simples, além da estimativa dos coeficientes, é fundamental interpretar corretamente a variabilidade explicada pela variável independente. O coeficiente de determinação R2R2R^2 é uma medida que expressa o quanto da variação da variável dependente é atribuída ao modelo, sendo útil para avaliar a qualidade do ajuste. Entretanto, seu uso exige compreensão das relações entre os componentes da soma dos quadrados envolvidos na análise de variância.

Com relação a este contexto e sobre a análise de variância e interpretação do erro padrão na regressão linear simples, analise as asserções a seguir e a relação proposta entre elas:

I. Quanto maior for a soma dos quadrados dos resíduos SQRes, maior tende a ser o erro padrão estimado do coeficiente angular β1β1 \beta_1 .

PORQUE

II. O erro padrão de β1β1 \beta_1 é diretamente proporcional ao quadrado da diferença entre os valores observados de xx x e sua média.

A respeito dessas asserções, assinale a alternativa correta:

A

As asserções I e II são falsas.

B

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

C

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

D

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

E

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

#2

O coeficiente de inclinação  β₁ é uma medida fundamental em análises estatísticas de regressão, pois quantifica a relação entre a variável independente e a variável dependente. A análise do intervalo de confiança para β₁ é crucial para avaliar a precisão dessa estimativa e determinar se há evidência estatística de uma relação linear significativa entre as variáveis. Um intervalo de confiança que não inclui o valor zero sugere que o coeficiente β₁ é estatisticamente significativo e que a relação entre as variáveis é robusta.

Com base nessas informações, observe as afirmativas a seguir sobre o coeficiente 1 e sua verificação em modelos de regressão.

I. O coeficiente β₁ é utilizado para medir a força e a direção da relação linear entre duas variáveis.

II. A confiabilidade do coeficiente β₁ , medida pelo seu intervalo de confiança, é essencial para validar modelos preditivos.

III. Um coeficiente 1 próximo de zero indica uma fraca ou inexistente correlação linear entre as variáveis analisadas.

IV. O cálculo correto do intervalo de confiança para β₁ pode ajudar a identificar a significância estatística da relação entre as variáveis.

V. O coeficiente β₁ é irrelevante para análises estatísticas de regressão simples.

É correto o que se afirma em:

A

I, II e IV, apenas

B

II e IV, apenas

C

III e V, apenas .

D

I e III, apenas

E

I, II, III, IV e V.

#3

O coeficiente de determinação, indicado por , é uma métrica utilizada na análise de regressão para avaliar o quanto um modelo consegue explicar a variação dos dados. Esse coeficiente é calculado com base em valores obtidos a partir do modelo e dos dados observados.

Com base nessa informação, qual das opções a seguir expressa corretamente como se calcula o coeficiente de determinação?

A) é a soma dos quadrados explicados dividida pela soma dos quadrados totais, ou seja, R² = (SQE) / (SQT) .

B) é a soma dos quadrados dos resíduos dividida pela soma dos quadrados explicados, ou seja, R² = (SQR) / (SQE) .

C) é a raiz quadrada da soma dos quadrados totais multiplicada pela soma dos quadrados explicados, ou seja, R² = √(SQT × SQE) .

D) é a diferença entre a soma dos quadrados explicados e a soma dos quadrados dos resíduos, dividida pela soma dos quadrados totais, ou seja, R² = SQE - SQR .

E) é o logaritmo natural da soma dos quadrados totais dividido pela soma dos quadrados dos resíduos, ou seja, R² = log (SQT) / (SQR)

A

é o logaritmo natural da soma dos quadrados totais dividido pela soma dos quadrados dos resíduos, ou seja, R² = log (SQT) / (SQR)

B

é a raiz quadrada da soma dos quadrados totais multiplicada pela soma dos quadrados explicados, ou seja, R² = √(SQT × SQE) .

C

é a soma dos quadrados dos resíduos dividida pela soma dos quadrados explicados, ou seja, R² = (SQE) / (SQT) .

D

é a soma dos quadrados explicados dividida pela soma dos quadrados totais, ou seja, R² = (SQE) / (SQT) .

E

é a diferença entre a soma dos quadrados explicados e a soma dos quadrados dos resíduos, dividida pela soma dos quadrados totais, ou seja, R² = SQE - SQR .

#4

Na análise estatística de dados, a regressão linear é uma ferramenta utilizada para determinar a relação entre duas variáveis quantitativas. A reta de regressão é determinada pelos coeficientes angular (b) e linear (a). 

Assinale a alternativa que corretamente descreve o coeficiente angular (b) na reta de regressão linear.

A
Indica a inclinação da reta de regressão.
B
Representa o ponto onde a reta intercepta o eixo Y.
C
É sempre igual a zero.
D
Determina a variabilidade dos dados em torno da média.
E
Representa a média dos valores de Y.
#5

Em um processo de modelagem estatística para prever uma variável contínua a partir de uma preditora, foi realizado o ajuste de um modelo de regressão linear simples com uma amostra de 282828 elementos. A relação entre as variáveis apresenta tendência linear negativa. O coeficiente angular β1β1\beta_1 estimado foi 0,0135−0,0135-0,0135 com um erro padrão associado de 0,0002870,0002870,000287. A equipe busca interpretar a estabilidade do modelo por meio de um intervalo de confiança para β1β1\beta_1, com 959595% de confiança.

Adicionalmente, a análise requer utilizar a distribuição ttt de Student considerando o número de graus de liberdade corretos, conforme padrão inferencial.

Com base nos dados fornecidos e utilizando a tabela t-Student anexa, determine o intervalo de confiança bilateral de 959595% para o parâmetro β1β1\beta_1. Para isso, aplique a fórmula do intervalo:

IC=β^1±t(1α/2,n2)EPIC=β^1±t(1−α/2,n−2)⋅EPIC = \hat{\beta}_1 \pm t_{(1-\alpha/2,\;n-2)} \cdot EP

Onde EP é o erro padrão de β1β1\beta_1 e ttt é o valor da distribuição ttt para o nível de confiança indicado.

Assinale a alternativa que apresenta o intervalo de confiança para β1β1\beta_1 com 959595% de confiança.

A

[0,0141; 0,0129][−0,0141; −0,0129][-0,0141;\ -0,0129]

B

[0,0144; 0,0126][−0,0144; −0,0126][-0,0144;\ -0,0126]

C

[0,0142; 0,0128][−0,0142; −0,0128][-0,0142;\ -0,0128]

D

[0,0140; 0,0130][−0,0140; −0,0130][-0,0140;\ -0,0130]

E

[0,0143; 0,0127][−0,0143; −0,0127][-0,0143;\ -0,0127]

#6

O método dos mínimos quadrados é uma técnica estatística, frequentemente empregada em análises de regressão linear. Essa abordagem é essencial para ajustar um modelo linear aos dados, permitindo que se faça uma estimativa precisa das relações entre variáveis independentes e dependentes. Utilizando este método, é possível determinar os coeficientes da regressão que melhor representam o comportamento dos dados observados, proporcionando uma base sólida para previsões e inferências estatísticas.

Assinale a alternativa que descreve o principal objetivo do método dos mínimos quadrados.

A
Minimizar a soma dos valores absolutos das diferenças entre os valores observados e os valores previstos pela regressão.
B
Maximizar a soma dos quadrados das diferenças entre os valores observados e os valores previstos pela regressão.
C
Minimizar a soma dos quadrados das diferenças entre os valores observados e os valores previstos pela regressão.
D
Minimizar a soma dos produtos entre os valores observados e os valores previstos pela regressão.
E
Maximizar a soma dos valores absolutos das diferenças entre os valores observados e os valores previstos pela regressão.
#7

A regressão linear é uma técnica estatística utilizada para modelar uma relação. Durante o processo de regressão linear, certos procedimentos são seguidos para garantir a precisão do modelo.

Sobre os procedimentos básicos para realizar a regressão linear, assinale a alternativa correta.

A
Aplicar a técnica de clustering antes da regressão.
B
Identificar a variável dependente e as variáveis independentes.
C
Excluir todos os dados que apresentam outliers.
D
Substituir dados ausentes com valores arbitrários.
E
Determinar a correlação entre as variáveis dependentes.
#8

O erro padrão estimado (EPE) é uma medida utilizada em análises estatísticas para avaliar a precisão das estimativas de coeficientes de um modelo de regressão. O EPE é fundamental para entender a variabilidade dos estimadores e a confiabilidade das previsões feitas pelo modelo.

Analise as afirmações a seguir sobre o erro padrão estimado e assinale a alternativa correta.

A
O erro padrão estimado é sempre maior que o valor do coeficiente de regressão, devido às variáveis dos coeficientes.
B
O EPE é a soma dos quadrados dos resíduos dividida pelo número de observações menos de parâmetros estimados.
C
O EPE é utilizado para calcular o intervalo de confiança dos coeficientes de regressão, indicando a confiabilidade das estimativas.
D
O EPE diminui à medida que o tamanho da amostra aumenta, mantendo-se constantes as variáveis dos coeficientes.
E
O erro padrão estimado pode ser negativo se os erros do modelo forem sistematicamente baixos.
#9

Ao interpretar um modelo de regressão linear, não basta observar os coeficientes estimados. Também é necessário avaliar a fração da variabilidade total que é explicada pela variável independente. O coeficiente de determinação R2R2R^2 é uma métrica importante que permite estimar o grau de explicação do modelo, mas sua interpretação deve ser feita com cautela.

Durante a aplicação de um modelo de regressão linear simples com n=15n=15n = 15 observações, foram obtidos os seguintes resultados:

- Soma total dos quadrados: SQTotal=280SQTotal=280SQ_{Total} = 280

- Soma dos quadrados da regressão: SQReg=210SQReg=210SQ_{Reg} = 210

Com base nessa situação, avalie as asserções abaixo e a relação proposta entre elas:

I. O valor do coeficiente de determinação R2R2R^2 é de aproximadamente 0,750,750,75, indicando que o modelo explica 75% da variação total da variável dependente.

PORQUE

II. O valor de R2R2R^2 é obtido pela razão entre a soma dos quadrados da regressão SQRegSQRegSQ_{Reg} e a soma total dos quadrados SQTotalSQTotalSQ_{Total}, conforme:

R2=SQRegSQTotalR2=SQRegSQTotalR^2 = \dfrac{SQ_{Reg}}{SQ_{Total}}

A respeito dessas asserções, assinale a alternativa correta:

A

As asserções I e II são falsas.

B

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

C

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

#10

Durante a construção de um modelo de regressão linear simples, uma amostra de n=28n=28n = 28 observações foi utilizada. O coeficiente angular β1β1 \beta_1 foi estimado como 0,0135−0,0135-0,0135, com erro padrão de 0,0002870,0002870,000287. Para analisar a precisão da estimativa, um intervalo de confiança de 959595% foi solicitado, utilizando a distribuição t-Student.

Com base nessa situação, analise as afirmativas a seguir:

I. O número de graus de liberdade é igual a 262626, considerando os parâmetros ajustados no modelo.

II. O valor crítico da t-Student com 959595% de confiança e 262626 graus de liberdade é 2,0562,0562,056.

III. A amplitude do intervalo obtido com os dados informados é próxima de 0,00120,00120,0012.

IV. O intervalo gerado indica uma relação negativa entre as variáveis analisadas.

Está correto o que se afirma em:

A

I e III, apenas.

B

II e IV, apenas.

C

I, III e IV, apenas.

D

I, II, III e IV.

E

I, II e IV, apenas.

#11

Um analista de desempenho está estudando a relação entre o número de horas de prática (variável independente) e a pontuação final em um teste de habilidade técnica (variável dependente) usando uma regressão linear simples. O coeficiente de inclinação (b) encontrado foi de 0,75.

Com base nesses dados, qual das seguintes interpretações é correta a respeito do coeficiente de inclinação?

A
O coeficiente de inclinação representa a pontuação mínima possível no teste, independentemente das horas de prática.
B
Um coeficiente de 0,75 significa que para cada hora de prática, a pontuação no teste aumentará exatamente 75% do valor total possível.
C
O coeficiente de inclinação sugere que o valor da pontuação final no teste será sempre igual ao número de horas de prática multiplicado por 75.
D
O coeficiente de inclinação indica o aumento esperado na pontuação para cada hora adicional de prática.
E
O coeficiente de inclinação indica que, independentemente das horas de prática, o valor final do teste será sempre 0,75.
#12

Uma equipe técnica está avaliando os efeitos dos investimentos em marketing sobre o volume de vendas mensais de um produto. O objetivo é construir um modelo preditivo que possibilite estimar os resultados futuros com base nos valores investidos, utilizando regressão linear simples. Para isso, foram coletados dados ao longo de cinco meses consecutivos.

Os dados obtidos foram organizados como pares ( xᵢ, yᵢ ), nos quais xᵢ representa o valor investido em publicidade (em milhares de reais), e y_i indica a quantidade de produtos vendidos (em centenas de unidades):

xᵢ | yᵢ | 2 4 3 5 5 7 7 10 9 15

Considerando os dados apresentados e a aplicação do método dos mínimos quadrados, o valor do coeficiente angular β₁ , que representa a inclinação da reta de regressão linear ajustada, deve ser determinado com base nas médias e nas somas dos produtos e quadrados associados aos dados amostrais.

Assinale a alternativa que contém o valor do coeficiente angular β₁ .

A

52 / 31

B

59 / 29

C

49 / 30

D

47 / 27

E

53 / 28

#13

A análise de regressão linear é uma ferramenta estatística fundamental utilizada para compreender as relações entre variáveis. Dentro deste contexto, o coeficiente de determinação  é um valor que indica a proporção da variância na variável dependente que é explicada pela variável independente no modelo de regressão.

Considere as seguintes afirmações e relações sobre o coeficiente de determinação : Associe corretamente cada afirmação com a explicação correspondente. Considere que nem todos os itens das colunas podem possuir associação ou podem possuir mais de uma correlação.

Coeficiente R²

Explicação

I. O valor de  varia entre 0 e 1.

A. Indica que o modelo de regressão tem alta precisão para explicar a variabilidade dos dados.

II. Um  próximo de 1 indica que o modelo de regressão explica bem a variabilidade dos dados.

B. Um  alto, por si só, não garante que o modelo seja adequado, pois outros fatores, como a multicolinearidade ou outliers, podem afetar a qualidade do ajuste.

III. Um  baixo sugere que o modelo de regressão não explica bem a variabilidade dos dados.

C. Um  baixo indica que o modelo tem pouca capacidade de explicar a variabilidade dos dados.

IV. O  pode ser interpretado como a proporção da variância total que é explicada pela variância do modelo.

D. O  é a fração da variância total da variável dependente que é capturada pelo modelo.

V. Um alto R² sempre garante que o modelo é adequado.

E. O R² sempre se situa em um intervalo entre 0 e 1, onde 0 significa nenhum ajuste e 1 significa ajuste perfeito.

Assinale a alternativa que contém a associação correta:

A

I - E, II - A, III - C, IV - D, V - B

B

I - C, II - A, III - D, IV - E, V - B

C

I - E, II - C, III - A, IV - B, V - D

D

I - D, II - B, III - A, IV - E, V - C

E

I - A, II - E, III - D, IV - C, V - B

#14

Durante a construção de um modelo de regressão linear simples baseado em n=10n=10n=10 observações, obteve-se o coeficiente angular estimado β1=0,84β1=0,84\beta_1 = 0,84, com erro padrão associado de 0,120,120,12 . Com o objetivo de estimar a amplitude provável para o parâmetro populacional correspondente, decidiu-se calcular o intervalo de confiança de 959595% , assumindo que os resíduos seguem distribuição normal. Com base nos dados apresentados e nas ferramentas estatísticas adequadas, analise as afirmativas a seguir:

I. O número de graus de liberdade utilizados no cálculo da variância residual é oito, considerando os parâmetros estimados no modelo.

II. O valor crítico da distribuição ttt para 959595% de confiança e oito graus de liberdade é aproximadamente 2,3062,3062,306 .

III. O intervalo de confiança construído apresenta margem de erro simétrica com amplitude de aproximadamente 0,280,280,28 .

IV. O intervalo de confiança obtido contém todos os valores plausíveis para o parâmetro populacional β1β1\beta_1 com 959595% de confiança.

Está correto o que se afirma em:

A

II e III, apenas.

B

I, II, III e IV.

C

I, III e IV, apenas.

D

I, II e IV, apenas.

E

I e III, apenas.

#15

Durante a avaliação de um modelo de regressão linear simples, uma equipe estatística busca compreender a dispersão dos resíduos para validar o ajuste do modelo. Como parte do processo, é necessário determinar a variância estimada dos erros, que oferece um indicativo da consistência entre os dados observados e os valores previstos pelo modelo ajustado.

Considerando um modelo de regressão linear simples ajustado com n=8n=8n=8 pares de observações, obteve-se a soma dos quadrados dos resíduos igual a SQ=12,4SQ=12,4SQ = 12,4. Com base nesse valor, deve-se identificar a variância estimada dos erros (s2s2s^2), considerando a fórmula apropriada para essa finalidade.

Nesse sentido, identifique a alternativa que identifica o valor da variância estimada.

A

s² = (12,4) / 7 = 1,77

B

s² = (12,4) / 5 = 2,48

C

s² = (12,4) / 6 = 2,07

D

s² = (12,4) / 8 = 1,55

E

s² = (12,4) / 10 = 1,24

Semana 3 14

#1

Um analista está conduzindo um estudo sobre a influência da experiência profissional nas vendas de uma equipe comercial. Após coletar dados e ajustar um modelo de regressão linear simples, ele deseja analisar a significância estatística do coeficiente angular. Para isso, ele realiza um teste de hipótese tradicional, sem considerar previamente os resultados, focando apenas no processo de cálculo necessário.

Sabendo que o valor estimado para o coeficiente angular é β̂₁ = 2,3 , com erro padrão igual a 0,5 , e que se deseja testar a hipótese  H₀: β₁ = 0 contra H_1: β₁ ≠ 0 , assinale a alternativa que contém o valor correto da estatística t do teste, considerando 14 graus de liberdade.

A

t = (2,3 - 1) / (0,5) = 2,6

B

t = (2,3) / 2 = 1,15

C

t = (0 - 2,3) / (0,5) = - 4,6

D

t = (2,3 - 0) / (0,5) = 4,6

E

t = (2,3 - 0) / 2 = 1,15

#2

Em uma análise de regressão linear simples, o parâmetro β₀ representa o intercepto da reta ajustada. Suponha que você tem os seguintes valores de uma amostra para realizar um teste de hipótese sobre 0. A média amostral da variável Y é Ȳ = 5 , a média da variável é X é ssXX=10

A fórmula para o teste t para 0 é dada por:

t = (β₀) / (SE (β₀)) onde  SE (β₀) = √(α² (1 + 1 / n + (x̄ ²) / SSXX)) é a variância dos resultados. Com base suponha α² = 4 e n = 1 0.

Assinale a alternativa que corretamente representa a fórmula para calcular

𝑡 no teste de hipótese para 0:

A

t = (β₀) / (√(a² / n))

B

t = (β₀) / (√((a² (1 + 1 / n)) / (n)))

C

t = (β₀) / (√((a²) / (ssXX)))

D

t = (β₀) / (√((a² (1 + 1 / n) + (8²) / (ssXX)) / (n)))

E

t = (β₀) / (√((a² (1 + 1 / n)) / (ssXX)))

#3

Pesquisadores desenvolveram um modelo de regressão linear simples para explicar a produtividade de funcionários em função de horas de capacitação. O parâmetro β₁ foi estimado em β̂₁ = 1,5 com erro padrão de 0,5, utilizando 16 observações. Os pesquisadores aplicaram um teste de hipótese unilateral à direita, com α=0,05.

Com base nesse cenário e sobre o teste de hipótese realizado e a significância do coeficiente angular, analise as afirmações a seguir:

I. O valor da estatística t é maior que o valor crítico da distribuição t para 14 graus de liberdade e α=0,05, justificando a rejeição de H₀ .

II. O valor da estatística t é 3,0, indicando que o coeficiente estimado está a três erros padrões de distância do valor hipotético.

III. O valor crítico da t-student neste caso é aproximadamente 2,145, que não é ultrapassado pela estatística t, indicando que H₀ não deve ser rejeitada.

IV. O teste foi realizado com 14 graus de liberdade, pois se subtrai dois parâmetros do total da amostra no modelo de regressão linear simples.

Está correto o que se afirma em:

A

II, III e IV, apenas.

B

I, II e IV, apenas.

C

II e IV, apenas.

D

I, II, III e IV.

E

I e III, apenas.

#4

Pesquisadores de um centro universitário analisam a relação entre o número de eventos acadêmicos frequentados pelos alunos e o seu desempenho médio nas avaliações. Um modelo de regressão foi ajustado e, para verificar a significância do coeficiente angular, os pesquisadores aplicaram um teste de hipótese unilateral com nível de significância de α=0,05 e 12 graus de liberdade.

Considerando que o valor estimado de β̂₁ = 1,2 e o erro padrão do coeficiente é 0,4, temos que o valor da estatística t é igual a [preencher 1], e o valor crítico para o teste unilateral à direita é [preencher 2]. Com isso, a decisão correta é [preencher 3].

Nesse sentido, assinale a alternativa que contém os valores corretos que substituem as lacunas do trecho acima.

A

1 - 2,0; 2 - 2,179; 3 - não rejeitar  H₀

B

1 - 3,0; 2 - 1,782; 3 - rejeitar  H₀

C

1 - 1,2; 2 - 1,782; 3 - rejeitar  H₀

D

1 - 3,0; 2 - 3,930; 3 - rejeitar  H₀

E

1 - 1,8; 2 - 1,782; 3 - não rejeitar  H₀

#5

No contexto de análise de regressão, o teste de hipóteses é usado para verificar a significância dos coeficientes da regressão. Cada coeficiente tem uma hipótese nula associada. O teste de hipóteses envolve calcular a estatística t e compará-la com um valor crítico ou usar o p-valor para tomar decisões sobre os coeficientes.

Com base no apresentado sobre as etapas do processo de teste de hipóteses, observe as afirmativas a seguir.

I. A hipótese nula para um coeficiente de regressão é que ele é diferente de zero, hipótese nula para um coeficiente de regressão.

II. A estatística t é utilizada para testar a significância dos coeficientes de regressão, na análise de regressão.

III.Um p-valor baixo sugere que é improvável que a hipótese nula seja verdadeira.

IV. Se o coeficiente de regressão é significativo, isso implica uma relação linear entre a variável independente e a dependente.

V. O valor crítico para a estatística t depende do nível de significância escolhido e dos graus de liberdade.

Está correto o que se afirma em:

A
II e III, apenas.
B
I, II, III e IV, apenas.
C
II, III e IV, apenas.
D
II, III, IV e V, apenas.
E
I e II, apenas.
#6

No contexto de análises estatísticas, os intervalos de previsão são fundamentais. Durante a disciplina, foi mencionado que o cálculo do intervalo de previsão envolve várias etapas e fórmulas específicas.

Considerando os conceitos discutidos, assinale a alternativa que descreve o processo inicial de cálculo de um intervalo de previsão:

A
Determinar o intervalo de confiança para a média da variável independente.
B
Determinar a média da variável dependente para todos os dados coletados.
C
Calcular a soma dos resíduos entre os valores observados e os valores previstos.
D
Estimar o valor esperado da variável dependente utilizando o modelo de regressão.
E
Calcular a variância da variável independente utilizada no modelo.
#7

Um pesquisador está avaliando a relação entre o número de horas de estudo e o desempenho de alunos em um curso de matemática. Com base nos dados, ele ajusta um modelo de regressão linear e realiza um teste de hipótese para verificar se o coeficiente angular é estatisticamente maior que zero. Considere, sabendo-se que o valor estimado para o coeficiente  β̂₁ foi de 1,4, com erro padrão de 0,5, e que o teste unilateral foi realizado ao nível de significância de 5%, com 14 graus de liberdade.

Conforme a situação acima, assinale a alternativa correta.

A

A estatística t é igual a 2,8 e o valor crítico é 2,624, portanto a hipótese nula não deve ser rejeitada.

B

A estatística t é igual a 2,8 e o valor crítico é 3,733, portanto a hipótese nula deve ser rejeitada.

C

A estatística t é igual a 2,8 e o valor crítico é 1,761, portanto a hipótese nula deve ser rejeitada.

D

A estatística t é igual a 1,4 e o valor crítico é 1,761, portanto a hipótese nula deve ser rejeitada.

E

A estatística t é igual a 1,8 e o valor crítico é 1,761, portanto a hipótese nula não deve ser rejeitada.

#8

Em um experimento conduzido para modelar a relação entre temperatura ambiente e o desempenho de equipamentos eletrônicos, foi ajustado um modelo de regressão linear simples utilizando 25 observações. A média dos valores de temperatura na amostra foi x̄ = 30 , e a soma dos quadrados dos desvios ∑ (xᵢ - x̄)² = 400 . O erro padrão da regressão foi s=3.

Considerando a necessidade de prever um novo valor de resposta Y para X=35, assinale a alternativa que contém o valor mais coerente para o erro padrão total da predição:

A

EP = 3 × √(1 + 1 / 25 + ((35 - 30)²) / 400) ≈ 4,263

B

EP = 3 × √(1 + 1 / 25) ≈ 3,295

C

EP = 3 × √(1 + 25 / 400) ≈ 3,408

D

EP = 3 × √(1 + ((35 - 30)²) / 400) ≈ 4,061

E

EP = 3 × √(1 + 1 / 25 + 25 / 400) ≈ 3,986

#9

Em uma análise de regressão linear simples, os parâmetros β0 e β1 são estimados a partir dos dados de uma amostra. Após obter as estimativas, é comum testar hipóteses sobre esses parâmetros para verificar a significância da relação entre as variáveis envolvidas. Considere uma pesquisa onde se deseja testar a hipótese de que não há relação linear entre a variável independente X e a variável dependente Y.

Diante disso, assinale a alternativa que corretamente representa a hipótese nula ( H₀ )para o teste de significância do parâmetro β1:

A

H₀: 10

B

H₀: 𝛽 _0 ≠ 0

C

H₀: β₁ > 0

D

H₀: β₁ = 0

E

H₀: β₀ = 0

#10

Os intervalos de previsão são utilizados para fornecer uma estimativa de onde novos dados podem se situar, com um certo nível de confiança. Esses intervalos são especialmente úteis em previsões baseadas em modelos de regressão linear, onde é possível calcular tanto intervalos de confiança para a média prevista quanto intervalos de previsão para novos valores. Suponha que você tenha um modelo de regressão linear e deseja calcular o intervalo de previsão para uma nova observação.

Assinale a alternativa que apresenta o intervalo de previsão.

A
Um intervalo que estima a faixa em que novos valores de dados podem se situar, com um determinado nível de confiança, baseando-se no modelo de regressão.
B
Um intervalo que contém a média de uma amostra com um determinado nível de confiança.
C
Um intervalo que contém a moda de uma amostra com um determinado nível de confiança.
D
Um intervalo que descreve a variação total dos dados sem considerar novos valores, pois reflete uma previsão.
E
Um intervalo que contém a mediana de uma amostra com um determinado nível de confiança.
#11

Em uma análise de regressão linear simples, é importante formular hipóteses para testar a significância dos parâmetros do modelo. Suponha que você está avaliando a relação entre uma variável independente X e uma variável dependente Y e deseja verificar se existe uma relação significativa entre X e Y com base no coeficiente angular β₁ .

Com base nessa situação, qual seria a hipótese alternativa H _α que você deve formular para testar se há uma relação significativa entre X e Y?

A

β₁ < 0

B

β₁ = 0

C

β₁ ≥ 0

D

β₁ > 0

E

β₁ ≠ 0

#12

Em experimentos de engenharia, muitas vezes é necessário não apenas prever valores futuros, mas também avaliar com que precisão essas previsões são feitas. Quando um modelo de regressão linear simples é ajustado, tanto o intervalo de confiança para o valor médio quanto o intervalo de previsão para uma nova observação podem ser calculados. A escolha correta e a interpretação dos dois tipos de intervalos dependem do entendimento estatístico da variabilidade envolvida.

Considere o modelo de regressão linear simples ajustado a partir de n=18 observações, com:

x̄ = 36,6111

S com x x subscrito = 4840,7778

s = 2,8640

x ^* = 45

ŷ = 13,79

s _(ŷ) = 0,7582

t com 0,025, 16 subscrito = 2,120

Com base nesses dados, avalie as afirmativas a seguir:

I. O intervalo de confiança de 95% para o valor médio quando x=45 é aproximadamente (12,18, 15,40).

II. O intervalo de previsão de 95% quando x=45 é menor que o intervalo de confiança da média.

III. A distância entre x ^* e influencia diretamente a largura do intervalo.

IV. O intervalo de previsão nunca se reduz a um ponto, mesmo com amostras muito grandes.

Está correto o que se afirma em:

A

I, III e IV, apenas.

B

II, III e IV, apenas.

C

I, II e III, apenas.

D

I e III, apenas.

E

I, II, III e IV.

#13

Uma análise estatística foi conduzida para avaliar se o tempo de leitura semanal influencia a nota final de estudantes universitários. Para isso, foi estimado um modelo de regressão linear simples com n=18 observações. O coeficiente angular foi estimado em β̂₁ = 2,4 com erro padrão igual a 0,8.

Deseja-se testar, ao nível de significância α=0,05, a hipótese H₀: β₁ = 0 contra a hipótese alternativa H₁: β₁ > 0 . Com base nessas informações, analise as seguintes afirmativas:

I. A estatística t para o teste é igual a 3,0, sendo suficiente para rejeitar H₀ em um teste unilateral.

II. O valor crítico da distribuição t com 16 graus de liberdade e α=0,05 unilateral é aproximadamente 1,746.

III. A decisão correta do teste é não rejeitar H₀ , pois o valor da estatística t é inferior ao valor crítico.

IV. O número de graus de liberdade no teste é obtido por n-2, totalizando 16.

Está correto o que se afirma em:

A

II e III, apenas.

B

II e IV, apenas.

C

I, II, III e IV.

D

I, II e IV, apenas.

E

I e III, apenas.

#14

Nas análises estatísticas, é crucial identificar corretamente as etapas e as fórmulas utilizadas para determinar intervalos de previsão. Essa habilidade permite que previsões e estimativas sejam feitas com um grau conhecido de confiança. 

Com base nas etapas de intervalos de previsão estatístico, identifique e associe corretamente as etapas e fórmulas às suas descrições.

 Etapas e Fórmulas

Descrições

I. Coleta de dados

A. Utiliza-se para verificar se existe evidência estatística suficiente nos dados amostrais para rejeitar ou aceitar uma hipótese nula (H₀) em relação a uma hipótese alternativa  (H _α)

II. Construção do modelo

B. Estabelece limites para prever valores futuros baseando-se no modelo estatístico.

III. Intervalo de confiança

C. Processo inicial onde são obtidas as informações necessárias para a análise.

IV. Teste de hipótese

D. É uma estimativa do grau de incerteza associado à estimativa pontual do parâmetro.

V. Previsão da resposta

E. Criação de uma fórmula matemática que representa a relação entre as variáveis.

 

Assinale a alternativa que contém a associação correta.



A

I - C, II - E, III - D, IV - A, V - B

B

I - D, II - B, III - A, IV - E, V - C

C

I - C, II - E, III - B, IV - A, V - D

D

I - C, II - E, III - D, IV - B, V - A

E

I - A, II - C, III - E, IV - B, V - D

Semana 4 14

#1

O diagnóstico de modelos de regressão linear requer o exame cuidadoso de diversos pressupostos. Um dos mais sensíveis é a homocedasticidade, isto é, a constância da variância dos erros ao longo dos valores da variável preditora. Quando essa condição é violada, os métodos de estimação e teste podem ser profundamente afetados.

Durante o ajuste de um modelo linear simples, um estatístico percebe que os resíduos se distribuem de forma irregular: não exibem crescimento sistemático, mas também não apresentam dispersão constante. Ele aplica testes formais para avaliar a presença de heterocedasticidade, porém sem evidência conclusiva.

Com base nesse cenário e nos fundamentos estatísticos discutidos, avalie as asserções a seguir e a relação proposta entre elas:

I. A ausência de padrão visível nos resíduos é evidência conclusiva da homocedasticidade no modelo.

PORQUE

II. A homocedasticidade só pode ser comprovada estatisticamente por meio de gráficos visuais de resíduos.

A respeito dessas asserções, assinale a alternativa correta:

A
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
B
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
C
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
D
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
E
As asserções I e II são proposições falsas.
#2

Um engenheiro está analisando o crescimento populacional de uma cidade, e os dados mostram que o modelo de crescimento é exponencial. Ele deseja transformar este modelo não linear em uma forma linear para facilitar a interpretação dos parâmetros. O modelo exponencial que ele está analisando é dado pela função:

Em que P(t) representa a população em função do tempo ,  é o parâmetro inicial e  determina a taxa de crescimento. Para facilitar a análise, o engenheiro decide aplicar o logaritmo natural em ambos os lados da equação.

Com base nos assuntos estudados sobre adequação e linearização de modelos não lineares, assinale a alternativa correta que descreve a forma linear do modelo e como os parâmetros  e  podem ser interpretados após essa transformação.

A

transformação linear será representada por , onde  é o intercepto e β define a taxa de crescimento quadrática.

B

A forma linearizada será , onde  representa o intercepto e β a taxa de crescimento em relação ao tempo.

C

Após aplicar o logaritmo natural, a equação resultante é , onde  representa o intercepto e β é o coeficiente angular.

D

Ao aplicar o logaritmo, a função resultante será , com  indicando o coeficiente angular e β o intercepto inicial.

E

A transformação resultará em , onde  é o intercepto e β representa o efeito multiplicativo da variável .

#3

Durante uma análise estatística de dados educacionais, uma equipe de pesquisadores observou diferenças expressivas entre os valores medidos e os previstos por um modelo linear simples. Para investigar a adequação do modelo adotado, foi necessário transformar os resíduos em valores comparáveis, independentemente da escala original. Esse processo é fundamental para identificar padrões, anomalias e validar a distribuição dos erros.

Em um experimento estatístico, foram obtidos os seguintes resíduos para cinco observações:

e₁ = 1, e₂ = - 2, e₃ = 4, e₄ = - 3, e₅ = 3 .

Sabendo-se que o desvio padrão dos resíduos é s = 2 .

Conforme a situação apresentada acima, assinale a alternativa que contém o valor do resíduo padronizado da terceira observação.

A

z₃ = 1,00

B

z₃ = 2,50

C

z₃ = 3,00

D

z₃ = 2,00

E

z₃ = 1,50

#4

Os gráficos de diagnóstico são ferramentas visuais fundamentais para avaliar a adequação de modelos estatísticos. Eles permitem identificar possíveis problemas, como a linearidade, homocedasticidade, normalidade e independência dos resíduos, além de detectar outliers e pontos influentes.

Com base nisso, assinale a alternativa correta sobre a função dos gráficos de diagnóstico na análise de modelos estatísticos:

A
A dispersão uniforme dos pontos em torno da linha de zero, em um gráfico de resíduos, indica problemas de heterocedasticidade.
B
Os gráficos de diagnóstico podem ser utilizados para verificar a adequação dos pressupostos de normalidade, linearidade e homocedasticidade.
C
Os gráficos de diagnóstico são inadequados para identificar outliers ou influências indevidas no modelo.
D
A função dos gráficos de diagnóstico é verificar apenas se a hipótese nula pode ser aceita ou rejeitada.
E
A análise gráfica de diagnóstico serve exclusivamente para confirmar a normalidade dos resíduos.
#5

Modelos que não se ajustam inicialmente à linearidade podem, muitas vezes, ser reconfigurados via transformações matemáticas, permitindo análises estatísticas robustas. Contudo, nem toda transformação garante estimativas válidas ou interpretações corretas quando revertidas à escala original. Avaliar criticamente os métodos aplicados e suas implicações é essencial em inferências com variáveis transformadas.

Um pesquisador ajusta um modelo de regressão utilizando a transformação l, a fim de representar um comportamento de crescimento exponencial. Após análise dos resíduos e do valor de , ele obtém resultados que parecem satisfatórios, mas decide avaliar também os efeitos da transformação sobre os pressupostos do modelo original.

Com base neste contexto e nos princípios estatísticos estudados, analise as asserções a seguir e a relação proposta entre elas:

I. Um valor alto de na escala transformada não garante que o modelo transformado seja o melhor para a variável original.

PORQUE

II. O valor de  em modelos transformados mede apenas a variabilidade explicada em , e não em  diretamente.

A respeito dessas asserções, assinale a alternativa correta:

A

As asserções I e II são proposições falsas.

B

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

C

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

#6

A análise adequada de dados de contagem envolve considerar tanto a variabilidade intrínseca quanto a frequência de ocorrências nulas. É essencial avaliar se a variância dos dados corresponde à média e se há uma quantidade significativa de zeros que não pode ser explicada apenas pela distribuição escolhida.

Com base nos assuntos estudados sobre Modelos lineares generalizados para dados de contagem e categoria, interpretar a adequação de diferentes modelos para um conjunto de dados onde a média , e há uma proporção de 30% de contagens zero.

Assinale a alternativa que determina o modelo mais apropriado para esses dados.

A

Modelo Binomial Negativo

B

Modelo Poisson com dispersão

C

Modelo Binomial Negativo inflacionado de zeros (ZINB)

D

Modelo Poisson

E

Modelo Hurdle

#7

A adequação de modelos de regressão, sejam eles lineares ou não lineares, é fundamental para garantir que as previsões e estimativas geradas pelos modelos sejam confiáveis. Na regressão linear, a relação entre as variáveis é presumida como sendo linear, enquanto na regressão não linear, essa relação pode assumir diferentes formas. Em ambos os casos, é necessário verificar se o modelo ajustado se adequa bem aos dados, por meio de testes e da análise de resíduos, por exemplo. A qualidade do ajuste do modelo pode ser influenciada por diversos fatores, como a presença de outliers, a multicolinearidade e a escolha das variáveis explicativas.

Com base nisso, assinale a alternativa correta sobre a adequação de modelos de regressão.

A
A adequação de um modelo de regressão linear não é afetada pela presença de outliers.
B
Modelos não lineares sempre apresentam um ajuste melhor que os modelos lineares.
C
A análise dos resíduos é essencial para verificar a adequação de modelos de regressão.
D
A multicolinearidade entre variáveis explicativas não afeta a qualidade do modelo.
E
A escolha correta das variáveis explicativas é irrelevante na adequação modelos não lineares.
#8

Considere que temos um estudo sobre a fritura de batatas, onde a variável  representa o tempo de fritura em segundos e a variável  corresponde ao teor de umidade das batatas em porcentagem. Nosso objetivo é construir um modelo de regressão linear para prever o teor de umidade com base no tempo de fritura.

A partir dos dados coletados, verifique se a relação entre o tempo de fritura e o teor de umidade é linear. Observe as afirmativas a seguir:

I. Para verificar a adequação de um modelo linear, o gráfico de dispersão entre o tempo de fritura e o teor de umidade deve exibir os pontos distribuídos ao longo de uma linha reta.

II. A análise dos resíduos padronizados permite identificar possíveis pontos fora do padrão (outliers), e estes devem estar preferencialmente dentro do intervalo de

III. A relação linear pode ser confirmada se os pontos no gráfico de probabilidade normal dos resíduos se aproximarem de uma linha de 45 graus.

IV. O tempo de fritura é considerado a variável dependente, enquanto o teor de umidade é a variável independente neste contexto.

É correto o que se afirma em:

A

I, III e IV, apenas.

B

I, II, III e IV.

C

II e IV, apenas.

D

I e II, apenas.

E

I, II e III, apenas.

#9

Em avaliações práticas de modelos de regressão, o comportamento dos resíduos é essencial para a validação da adequação estatística. As flutuações dos resíduos em torno do eixo zero, sua variância e a ausência de padrões definidos são sinais esperados em um modelo ajustado corretamente. Análises gráficas e numéricas são complementares e indispensáveis nesse processo.

Considere que, em uma análise de regressão linear simples, foram observados os seguintes valores:

- Valor observado:

- Valor previsto:

- Desvio padrão estimado do resíduo:

Sabendo-se que o resíduo padronizado é utilizado para avaliar a magnitude da discrepância entre o valor observado e o previsto, determine o valor aproximado do resíduo padronizado e interprete sua significância em termos de ajuste do modelo.

Assinale a alternativa correta.

A

; indica que a observação está levemente abaixo e isso não compromete o modelo.

B

; indica que a observação coincide com o previsto, o que é ajuste ideal.

C

; indica que a observação está abaixo do previsto e pode sugerir inadequação.

D

−; indica que a observação está bem abaixo e há erro estrutural de previsão.

E

; indica que a observação está acima do previsto e isso é comum em bons modelos.

#10

Considere o exemplo de adequação onde a taxa de liberação na área do queimador  e as emissões de   foram analisadas. A reta de regressão estimada foi , com  Com base nos dados e gráficos de resíduos padronizados apresentados:

O conceito de resíduos padronizados, no contexto da adequação de um modelo estatístico, refere-se a:

A

os valores observados subtraídos pelos valores previstos pelo modelo, ajustados pela variância dos resíduos.

B

os valores previstos pelo modelo subtraídos pelos valores observados, divididos pelo desvio padrão dos resíduos.

C

os valores previstos pelo modelo subtraídos pelos valores observados, ajustados pela variância dos resíduos.

D

os valores observados subtraídos pelos valores previstos pelo modelo, divididos pela média dos valores observados.

E

os valores observados subtraídos pelos valores previstos pelo modelo, divididos pelo desvio padrão dos resíduos.

#11

Os modelos para dados assimétricos positivos são amplamente empregados em análises que lidam com variáveis com valores exclusivamente positivos e distribuição enviesada. Em situações práticas, como na análise de sinistros e seguros, esses modelos possibilitam um ajuste mais preciso às características dos dados.

Com relação a este contexto e ao conteúdo estudado sobre modelos lineares generalizados para dados assimétricos e análise de banco de dados em modelos de contagem, examine as asserções a seguir e a relação proposta entre elas:

I. A regressão Skew-Normal é ideal para dados assimétricos positivos em modelos de contagem, sendo especialmente eficaz para modelar dados sem a necessidade de transformação e oferecendo uma solução para dados de contagem com zeros frequentes.

PORQUE

II. Para modelar dados assimétricos positivos, o modelo gama é frequentemente utilizado devido à sua flexibilidade de ajuste, e as ligações mais comuns incluem identidade, inversa e logaritmica.

A respeito dessas asserções assinale a alternativa correta:

A

As asserções I e II são falsas.

B

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

C

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

D

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

E

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

#12

A modelagem estatística é essencial na análise de dados, pois possibilita a previsão de resultados e o teste de hipóteses utilizando variáveis observadas. Um desafio importante é garantir que o modelo escolhido esteja adequadamente ajustado aos dados.
Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas.

I. A verificação da adequabilidade do modelo é essencial para garantir a precisão das previsões estatísticas.

PORQUE 

II. A aplicação de modelos não lineares não exige a verificação de premissas como homoscedasticidade e independência.

A respeito dessas asserções assinale a alternativa correta:

A
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
B
As asserções I e II são falsas.
C
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
D
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
E
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
#13

Os modelos não lineares são utilizados para descrever relações complexas onde a relação entre as variáveis independentes e dependentes não é uma linha reta. Esses modelos podem assumir diferentes formas, como polinômios de grau superior, exponenciais, logarítmicos e outros. A escolha de um modelo não linear adequado depende da natureza dos dados e do fenômeno estudado.

Com base em seus estudos, identifique a característica que melhor descreve um modelo não linear.

A
A relação entre as variáveis independentes e dependentes é expressa por uma função que não é uma linha reta, podendo ser exponencial, logarítmica ou polinomial.
B
A relação entre as variáveis independentes e dependentes é sempre representada por uma linha reta.
C
As variáveis independentes não influenciam a variável dependente de maneira significativa.
D
As variáveis independentes e dependentes têm uma relação direta e também proporcional.
E
Os modelos não lineares são utilizados apenas quando os dados apresentam uma distribuição normal.
#14

Modelos estatísticos não lineares podem ser transformados para a forma linear por meio de operações como o logaritmo natural. Após o ajuste, é possível realizar previsões e estimar intervalos na escala transformada e então reconverter os resultados para a escala original. Porém, esse processo exige decisões críticas e conhecimento técnico para preservar a validade estatística.

Considere um modelo transformado do tipo:

Para o ponto , obteve-se , desvio padrão , com  observações. Adotando , o valor crítico da distribuição t de Student com 6 graus de liberdade é .

Com base nessas informações e na lógica estatística envolvida, analise as afirmativas a seguir:

I. A previsão na escala original é obtida aplicando exponencial ao valor previsto em log.
II. O intervalo de previsão em log é obtido somando e subtraindo o erro padrão multiplicado por t.
III. O intervalo de previsão na escala original é obtido exponenciando os limites do intervalo em log.

Está correto o que se afirma em:

A

I e II, apenas.

B

II e III, apenas.

C

I e III, apenas.

D

I, II e III.

E

I, apenas.

Semana 5 18

#1

Ao investigar fenômenos com resultados binários, pesquisadores frequentemente utilizam modelos que possibilitam estimar a probabilidade de um evento ocorrer com base em uma variável explicativa. Esses modelos são particularmente úteis quando a resposta pode assumir apenas dois valores, como sim ou não, sucesso ou fracasso, presença ou ausência.

Durante uma análise estatística de dados médicos, um pesquisador investiga a relação entre o tempo de exposição a um fator de risco e a probabilidade de manifestação de uma condição de saúde. Para modelar essa relação, ele adota a regressão logística, associando uma variável explicativa contínua  X à ocorrência do evento de interesse Y = 1 .

O modelo estimado fornece os coeficientes β₀ = - 1,2 e β₁ = 0,8 . A razão de chances (odds) para o evento de interesse é expressa por:

Odds (X) = (P (Y = 1 | X)) / (1 - P (Y = 1 | X)) = e^(β₀ + β₁ X)

Com base nesses dados, assinale a alternativa que contém a razão de chances para X = 3 :

A

Odds (3) = e^(2,4)

B

Odds (3) = e^(3,0)

C

Odds (3) = e^(4,8)

D

Odds (3) = e^(3,6)

E

Odds (3) = e^(1,2)

#2

Os métodos de regressão são utilizados para modelar a relação entre uma variável dependente e uma ou mais variáveis independentes. Entre os métodos de regressão mais comuns estão a regressão linear, a regressão polinomial e a regressão logística. Cada método tem aplicações específicas e é utilizado em diferentes contextos de análise de dados.

Neste sentido, assinale a alternativa que descreve a aplicação de métodos de regressão gerais.

A

A regressão linear é usada quando a relação entre as variáveis é não linear, por ser um ponto de regressão.

B

A regressão polinomial é uma extensão da regressão linear que permite curvaturas nos dados.

C

A regressão múltipla é usada apenas para dados categóricos em estudos e incorpora múltiplas variáveis

D

A regressão logística é usada para prever valores contínuos em análise e não para prever probabilidade.

E

A regressão exponencial é usada para modelar dados categóricos, onde a taxa de crescimento é constante,

#3

Os modelos polinomiais são amplamente utilizados em diversas áreas para representar relações não lineares entre variáveis. Eles são expressos como somas de termos de potência de uma variável independente. 

Nesse sentido, assinale a alternativa que define um modelo polinomial:

A
Um modelo que utiliza integrais de variáveis dependentes, sem usar polinômios.
B
Um modelo que representa distribuições normais, usando modelos de regressão.
C
Um modelo que representa relações lineares entre variáveis não lineares.
D
Um modelo que utiliza termos logarítmicos de uma variável independente.
E
Um modelo que utiliza uma soma de termos de potência de uma variável independente.
#4

A regressão logística é amplamente utilizada em contextos onde se busca entender fatores associados a um evento com duas possibilidades de resultado. Ela permite a análise de variáveis contínuas e categóricas para verificar o impacto de cada uma sobre a probabilidade de um determinado evento ocorrer.

Com base nos assuntos estudados sobre modelo de regressão logística e análise de resposta dicotômica, analise as afirmativas a seguir:

I. O modelo de regressão logística é ideal para tratar variáveis dicotômicas, ou seja, variáveis com resultados binários, como sucesso ou falha, onde os valores possíveis estão restritos a 0 e 1.

II. A equação do modelo logístico é comumente chamada de "razão das chances", ela permite modelar uma relação não linear entre a variável preditora e a probabilidade de sucesso.

III. A regressão logística gera uma função exponencial que se relaciona linearmente com o logaritmo das chances, o que possibilita interpretar a variável dependente como uma reta em um gráfico linear.
IV. O modelo logístico é restrito a variáveis preditoras binárias e
não pode ser utilizado para variáveis contínuas, como a idade ou o tempo, pois depende exclusivamente de categorias bem definidas.

É correto o que se afirma em:

A
I e III, apenas.
B
I, III e IV, apenas.
C
I e IV, apenas.
D
I, II e III, apenas.
E
II, III e IV, apenas.
#5

Em modelos que visam flexibilidade no ajuste de dados não lineares, técnicas não paramétricas como a regressão LOESS vêm ganhando destaque. Diferentemente dos métodos clássicos que atribuem o mesmo peso a todos os dados, LOESS ajusta múltiplas retas locais considerando pesos decrescentes à medida que os pontos se afastam do valor de referência. Esse processo requer computação intensiva, mas permite modelar padrões complexos de forma adaptativa.

Com relação ao tema da regressão localmente ponderada, analise as asserções a seguir e a relação proposta entre elas:

I. A regressão LOESS permite ajustar uma curva suave aos dados mesmo quando não há uma relação funcional clara entre as variáveis,

PORQUE

II. em cada ponto x ^* , uma regressão local é realizada com pesos atribuídos por proximidade, frequentemente usando uma função do tipo wᵢ = K ((| xᵢ - x ^* |) / h) , onde h  é a largura de suavização.

A

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

B

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

C

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

As asserções I e II são falsas.

#6

A construção de modelos preditivos permite que pesquisadores descrevam tendências em dados experimentais por meio de equações ajustadas. Ao considerar relações que não seguem padrões lineares simples, a inclusão de termos polinomiais oferece maior flexibilidade na representação da variabilidade observada nos fenômenos estudados.

Um pesquisador ajustou um modelo polinomial de segundo grau com N = 12 observações, e a soma dos quadrados dos resíduos obtida foi SQE = 96 .

Considerando os parâmetros envolvidos neste modelo, determina-se o valor da variância residual estimada σ̂² por meio da fórmula apropriada.

Diante disso, assinale a alternativa que contém a expressão da variância residual estimada:

A

σ̂² = 96 / 8

B

σ̂² = 96 / 9

C

σ̂² = 96 / 12

D

σ̂² = 96 / 10

E

σ̂² = 96 / 11

#7

Em pesquisas nas áreas de saúde e comportamento, é comum encontrar situações em que a variável resposta assume apenas dois estados possíveis, como presença ou ausência de uma condição clínica. Nesses contextos, os modelos estatísticos precisam lidar com essa natureza dicotômica da resposta. Um dos modelos mais utilizados para essa finalidade é o modelo logístico, que permite calcular a probabilidade de ocorrência de um evento em função de variáveis explicativas contínuas.

Em estudos com variáveis dependentes binárias, o modelo logístico é frequentemente utilizado para estimar a chance de ocorrência de um evento com base em variáveis explicativas contínuas. A relação é representada pela equação da razão de chances (odds), expressa como Odds (x) = e^(β₀ + β₁ x) , permitindo ao analista interpretar diretamente o efeito de X sobre a probabilidade do evento.

Considere um modelo logístico estimado com os parâmetros β₀ = - 1,5 e β₁ = 0,6 . Calcule a razão de chances (odds) associada a X = 5 e assinale a alternativa correta:

A

Odds (5) = e^( - 1,5 + 0,6 × 5) = e^(1,5) ≈ 6,15

B

Odds (5) = e^( - 1,5 - 0,6 × 5) = e^( - 4,5) ≈ 0,011

C

Odds (5) = e^( - 1,5 + 0,6 × 5) = e^(3,0) ≈ 20,09

D

Odds (5) = e^( - 1,5 + 0,6 × 5) = e^(1,5) ≈ 2,23

E

Odds (5) = e^( - 1,5 + 0,6 × 5) = e^(1,5) ≈ 4,48

#8

Os métodos de regressão, incluindo o modelo logístico, têm diversas aplicações práticas, especialmente quando se trata de prever eventos binários em contextos como saúde, economia e comportamento do consumidor. Esses métodos são valiosos para análise de probabilidades e tendências, ajudando a identificar padrões em grandes volumes de dados.

Com base nos assuntos estudados sobre métodos de regressão gerais e modelo logístico, assinale a alternativa correta.

A
No modelo logístico, a relação entre variáveis independentes e o resultado é sempre diretamente proporcional, sem necessidade de transformação.
B
O modelo logístico é adequado para prever a probabilidade de um evento binário, utilizando uma função que transforma a relação linear em uma curva sigmoidal.
C
O método de reamostragem bootstrap gera múltiplas amostras diferentes ao substituir algumas observações por valores aleatórios.
D
O erro no modelo logístico pode ser reduzido aumentando o número de variáveis independentes em proporção aos dados disponíveis.
E
O modelo logístico é projetado para dados em que a variável dependente assume valores contínuos e apresenta comportamento linear.
#9

A reamostragem é uma técnica estatística utilizada para estimar a precisão das estatísticas de amostra ao criar várias amostras simuladas a partir dos dados originais. Este método é essencial em situações onde a distribuição teórica das estatísticas não é conhecida.

Neste sentido, assinale a alternativa que exemplifica a aplicação da reamostragem.

A
Analisar a variabilidade dos dados com modelos de regressão
B
Aplicar testes de hipóteses para comparar duas médias amostrais.
C
Ajustar modelos não lineares para dados experimentais.
D
Utilizar modelos lineares para prever a demanda de um produto.
E
Estimar a média populacional através do método bootstrap.
#10

Deseja-se estimar a média de uma característica, mas tem poucos dados e quer evitar suposições rígidas de normalidade. A técnica de reamostragem resolve esse problema ao criar múltiplas amostras a partir dos dados existentes, permitindo calcular intervalos de confiança e estatísticas sem depender de distribuições assumidas. Com isso, estimativas como medianas podem ser obtidas com mais flexibilidade e precisão, usando a distribuição empírica gerada pela reamostragem.

Com base nos assuntos estudados sobre reamostragem, assinale a alternativa correta.

A
A reamostragem é um método que depende das características originais dos dados para estabelecer uma distribuição pré-definida.
B
Na reamostragem, é necessário ajustar os dados para que se adequem a uma distribuição paramétrica antes de realizar as estimativas.
C
A reamostragem gera intervalos de confiança a partir de dados coletados várias vezes, aumentando a precisão da análise.
D
A reamostragem exige amostras de tamanhos diferentes para criar uma distribuição estatística confiável.
E
A reamostragem permite criar múltiplas amostras a partir de uma amostra original, gerando uma distribuição empírica sem suposições de normalidade
#11

Imagine que você está ajustando uma curva para prever a trajetória de um projétil em movimento, onde os dados não seguem uma linha reta, mas sim uma curva. O modelo polinomial é ideal para esses casos, pois permite ajustes de segundo, terceiro ou maior grau, capturando variações complexas.

Com base nos assuntos estudados sobre modelo polinomial, assinale a alternativa correta.

A

Em um modelo polinomial, a soma dos quadrados dos resíduos é sempre nula para qualquer grau de polinômio.

B

Um polinômio de segundo grau e um de terceiro grau possuem a mesma forma de cálculo para a variância estimada.

C

Nos modelos polinomiais, o grau do polinômio não influencia o número de parâmetros que devem ser ajustados.

D

O coeficiente de determinação mede a proporção da variação nos dados explicada pelo modelo polinomial ajustado, variando entre 0 e 1.

E

A variância estimada em modelos polinomiais permanece constante para qualquer grau do polinômio.

#12

Modelos de regressão polinomial oferecem grande flexibilidade para representar padrões de dados complexos. No entanto, o uso de polinômios de grau elevado pode trazer efeitos colaterais importantes, como instabilidade numérica, aumento da variância dos coeficientes e sobreajuste. Um analista deve avaliar cuidadosamente o equilíbrio entre ajuste e interpretabilidade, considerando o impacto sobre os indicadores estatísticos do modelo.

Com base nesse contexto, analise as afirmativas a seguir:

I. Modelos com grau muito alto tendem a apresentar menor soma de quadrados dos resíduos, mas maior risco de sobreajuste.
II. A centralização da variável preditora melhora a precisão numérica e a estabilidade das estimativas, principalmente em modelos de grau elevado.
III. Ao aumentar o grau do polinômio, o  ajustado sempre aumenta, justificando automaticamente a adoção do modelo mais complexo.

Está correto o que se afirma em:

A

I e III, apenas.

B

I, II e III.

C

I e II, apenas.

D

I, apenas.

E

II e III, apenas.

#13

A análise de dados em estudos quantitativos requer modelos que possam lidar adequadamente com variáveis resposta categóricas. Em casos onde o desfecho é dicotômico, o modelo logístico torna-se uma ferramenta estatística apropriada para inferência. A interpretação correta dos coeficientes desse modelo é fundamental para extrair conclusões válidas e úteis para a tomada de decisão.

Em estudos envolvendo modelos de regressão logística, é comum investigar o efeito da variação da variável preditora X sobre a razão das chances de ocorrência de um evento dicotômico. Essa razão é modelada por uma função exponencial, e seu comportamento depende diretamente do valor estimado do coeficiente logístico β₁ . Considerando que o modelo estimado foi:

log ((P (Y = 1)) / (1 - P (Y = 1))) = - 2,5 + 0,04 X

Foi solicitado a um analista que avaliasse a variação da razão das chances ao se passar de um nível de X = 70 para X = 90 , ambos expressos em decibéis.

Com base nas propriedades do modelo logístico, analise as afirmativas a seguir:

I. O aumento de 20 unidades em X resulta na multiplicação da razão das chances por e^(0,80) .

II. O sinal positivo do coeficiente indica que valores maiores de X aumentam a probabilidade de Y = 1 .

III. A razão das chances é igual a e^(2,5) para qualquer valor de X , já que esse é o intercepto da função.

Está correto o que se afirma em:

A

I, apenas.

B

I e III, apenas.

C

I, II e III.

D

II e III, apenas.

E

I e II, apenas.

#14

Os modelos de regressão polinomial são fundamentais na análise estatística quando a relação entre as variáveis não é linear. Eles permitem capturar comportamentos complexos dos dados, como curvaturas e pontos de inflexão, que modelos lineares simples não conseguem representar adequadamente.

Com base nos assuntos estudados sobre regressão polinomial, analise os dados abaixo e determine os coeficientes do polinômio de segundo grau que melhor ajusta os dados.

Dados:
x: 1,2, 3,4
y: 2,3, 5,8

A

Os coeficientes são b₀ = 0, b₁ = 1 e b₂ = 1

B

Os coeficientes são b₀ = - 1, b₁ = 0,5 e b₂ = 0,2

C

Os coeficientes são b₀ = 1,5, b₁ = 0,2 e b₂ = 0,8

D

Os coeficientes são b₀ = 3, b₁ = - 1 e b₂ = 0,4

E

Os coeficientes são b₀ = 2, b₁ = - 0,5 e b₂ = 0,5

#15

Leia o trecho a seguir:

Em uma análise estatística experimental, um pesquisador ajustou um modelo de regressão polinomial de segundo grau a um conjunto de N = 15 observações. Após o ajuste, a soma dos quadrados dos resíduos foi calculada como SQE = 144 . Em modelos polinomiais, a estimativa da variância residual σ̂² é obtida pela razão entre a soma dos quadrados dos resíduos e o número de graus de liberdade residuais, definido pela diferença entre o número de observações e o número de parâmetros ajustados.

Nesse contexto, a estimativa da variância residual é expressa pela equação:

σ̂² = ([preencher 1]) / ([preencher 2])

Neste contexto, identifique os termos de [preencher 1] e [preencher 2] que são substituídos por:

A

1 – 120; 2 – 15

B

1 – 132; 2 – 13

C

1 – 144; 2 – 12

D

1 – 144; 2 – 15

E

1 – 132; 2 – 11

#16

O uso de modelos polinomiais em análise de dados permite ajustes mais flexíveis, especialmente quando a relação entre variáveis não é linear. A interpretação do coeficiente de determinação ajustado é importante para entender a proporção de variabilidade explicada pelo modelo.
Com relação a este contexto e do conteúdo estudado sobre modelos polinomiais e análise de variabilidade com o coeficiente de determinação, examine as asserções a seguir e a relação proposta entre elas:


I. A utilização do coeficiente de determinação ajustado em modelos polinomiais permite avaliar a proporção da variabilidade dos dados explicada pelo modelo, ajustando-se ao número de parâmetros utilizados.

PORQUE

II. Em modelos polinomiais, o coeficiente de determinação ajustado aumenta com o número de graus no polinômio, garantindo desta forma que se tenha um melhor ajuste dos dados.

A respeito dessas asserções, assinale a alternativa correta:

A
A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.
B
As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.
C
As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.
D
A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.
E
As asserções I e II são falsas.
#17

Intervalos de previsão são fundamentais para avaliar a precisão de modelos preditivos, especialmente quando o objetivo é estimar um valor futuro de Y dado um valor específico de X . Nos modelos polinomiais, esse cálculo depende do grau do polinômio, da variância residual e do número total de observações, além da estatística t da distribuição de Student.

Com relação ao tema dos intervalos de previsão, analise as asserções a seguir e a relação proposta entre elas:

I. O intervalo de previsão em modelos quadráticos é mais amplo que o intervalo de confiança, pois incorpora a variabilidade da previsão individual,

PORQUE

II. a expressão geral do intervalo de previsão é dada por:

ŷ ± t com α / 2 subscrito × s × √(1 + h (x₀))

em que h (x₀) representa o valor da diagonal da matriz de projeção para o ponto x₀ .

A respeito dessas asserções, assinale a alternativa correta:

A

As asserções I e II são falsas.

B

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

C

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

#18

A escolha de modelos estatísticos exige não apenas observar sua capacidade de ajuste aos dados, mas também considerar os critérios que penalizam a complexidade excessiva. Em muitos casos, modelos com maior número de parâmetros oferecem melhor aderência, mas isso nem sempre resulta em maior poder explicativo. O equilíbrio entre precisão e parcimônia é um desafio recorrente na análise estatística.

Em uma análise envolvendo dados experimentais, foram ajustados dois modelos distintos para prever o comportamento de uma variável dependente Y com base na variável X : um modelo linear simples e um modelo polinomial de terceiro grau. Ambos os modelos foram aplicados ao mesmo conjunto de N = 20 observações. Após os ajustes, observou-se que:

- O modelo linear apresentou R² = 0,89

- O modelo cúbico apresentou R² = 0,91

No entanto, ao calcular o coeficiente de determinação ajustado, os resultados se inverteram.

Com base nas informações fornecidas, analise as afirmativas a seguir:

I. O modelo cúbico perdeu qualidade explicativa ao considerar a penalidade pelos parâmetros adicionais.

II. O modelo linear apresenta menor capacidade de ajuste, mas maior parcimônia estatística.

III. O ajustado aumenta automaticamente com o grau do polinômio, independentemente dos dados.

Está correto o que se afirma em:

A

I, II e III.

B

I e III, apenas.

C

I, apenas.

D

I e II, apenas.

E

II e III, apenas.

Semana 6 20

#1

Um  elevado sugere que o modelo possui um bom ajuste aos dados, enquanto um  baixo indica que o modelo não explica bem a variabilidade observada. Compreender o conceito de  é essencial para avaliar a qualidade e a eficácia do modelo de regressão múltipla. Este entendimento ajuda a determinar a adequação do modelo para prever resultados e tomar decisões baseadas nos dados analisados.

Neste contexto, assinale a alternativa que determina a interpretação dos resultados dessa regressão múltipla.

A

pode variar entre -1 e 1, pois o modelo explica a variância da variável independente.

B

é sempre igual a 1 em um modelo de regressão múltipla, sem a variável de ajuste.

C

é uma medida utilizada na regressão múltipla para avaliar o ajuste do modelo.

D

indica a proporção da variância da variável dependente explicada pelos preditores.

E

não é uma medida utilizada na regressão múltipla, pois avalia o ajuste do modelo.

#2

A escolha de um modelo de regressão apropriado depende da natureza da relação entre a variável resposta e os preditores. Em alguns casos, relações não lineares podem ser melhor representadas através de modelos quadráticos, aumentando a capacidade preditiva. Avaliar a pertinência dessa escolha exige interpretação criteriosa das métricas de ajuste.

Durante um estudo sobre a produtividade de plantações agrícolas, foram ajustados dois modelos de regressão: um modelo linear múltiplo simples e um modelo quadrático completo, incluindo termos ao quadrado dos preditores e suas interações. Observou-se que o modelo quadrático apresentou um aumento de  de  em relação ao modelo linear, porém também aumentou em  o número de preditores.

Com relação a este tema e à análise crítica sobre a adequação do modelo quadrático, analise as asserções a seguir:

I. A adoção de modelos quadráticos completos pode levar a uma superestimação da capacidade preditiva se não houver evidências de que os termos quadráticos e de interação contribuem significativamente.

PORQUE

II. A simples elevação do valor de  não assegura a melhoria real do modelo, sendo necessária uma avaliação crítica com base em medidas ajustadas e testes de comparação.

A respeito dessas asserções, assinale a alternativa correta:

A

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

B

As asserções I e II são falsas.

C

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

D

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

E

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

#3

Em estudos estatísticos, diferentes formas de modelagem são utilizadas para representar relações entre variáveis. Algumas modelagens consideram apenas efeitos diretos, enquanto outras incorporam efeitos combinados ou de interação. Avaliar a adequação desses modelos requer análise crítica das mudanças na variabilidade explicada e não explicada.

Durante um estudo sobre o tempo de viagem de veículos, dois modelos de regressão múltipla foram ajustados: um modelo sem interação e um modelo com interação entre as variáveis distância percorrida (​) e número de entregas (​). Para o modelo sem interação, a soma dos quadrados dos resíduos foi  e, para o modelo com interação, , ambos com uma amostra de  observações.

Com relação a este tema e aos testes para comparação entre os dois modelos, analise as asserções a seguir e a relação proposta entre elas:

I. A estatística de teste para avaliar se o termo de interação melhora significativamente o modelo pode ser obtida pela razão entre a redução no  dividida pelo erro quadrático médio do modelo completo.

PORQUE

II. A inclusão de termos de interação em modelos de regressão múltipla pode resultar em melhores ajustes, mas aumenta o risco de superajuste se a diferença no  não for estatisticamente significativa.

A respeito dessas asserções, assinale a alternativa correta:

A

As asserções I e II são falsas.

B

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

C

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

#4

Os coeficientes de regressão no modelo de regressão múltipla indicam a relação entre as variáveis independentes e a variável dependente. Compreender a função dos coeficientes de regressão é fundamental para a correta interpretação dos resultados da regressão múltipla.

Diante disso, assinale a alternativa que descreve as características dos coeficientes de regressão.

A
Os coeficientes de regressão podem ser tanto positivos quanto negativos, mas sempre indicam uma relação constante entre as variáveis envolvidas, independentemente das suas magnitudes.
B
Os coeficientes de regressão indicam a mudança esperada na variável dependente para cada unidade adicional da variável independente, mantendo as demais variáveis constantes no modelo.
C
Os coeficientes de regressão têm um papel secundário na análise dos modelos de regressão, pois sua interpretação depende mais da variabilidade do modelo do que das variáveis em si.
D
Os coeficientes de regressão mostram a mudança na variável dependente por unidade da variável independente, sem considerar as outras variáveis presentes no modelo.
E
Os coeficientes de regressão são usados apenas para modelos de regressão linear simples e não têm função em modelos de regressão múltipla com várias variáveis independentes.
#5

Modelos de regressão múltipla são amplamente utilizados para avaliar o impacto de diversas variáveis preditoras em uma variável resposta, permitindo analisar tanto variáveis numéricas quanto categóricas. A interpretação dos coeficientes de cada variável fornece insights sobre a influência de cada fator quando outros fatores são mantidos constantes. 

Com base nos assuntos estudados sobre interpretação de parâmetros em modelos de regressão múltipla, assinale a alternativa correta.

A
No modelo de regressão múltipla, o coeficiente de uma variável numérica representa a diferença média na variável resposta quando a variável numérica está presente, enquanto os coeficientes das variáveis categóricas indicam o desvio padrão da resposta.
B
Em um modelo de regressão múltipla, os parâmetros das variáveis categóricas são interpretados como percentuais de variação na variável resposta, independentemente de outras variáveis.
C
Em uma análise de regressão múltipla, o efeito das variáveis categóricas é estimado diretamente pela média dos valores de resposta, enquanto as variáveis numéricas representam ajustes mais detalhados no modelo.
D
No modelo de regressão múltipla, o parâmetro associado a uma variável categórica indica a diferença média no valor da variável resposta quando a categoria está presente, mantendo as demais variáveis constantes.
E
O parâmetro de uma variável categórica em modelos de regressão múltipla expressa o efeito acumulado de todas as variáveis preditoras do modelo, sendo utilizado para prever valores médios.
#6

Em um estudo estatístico para prever o desempenho de produtos no mercado, um analista coletou dados de múltiplas variáveis que poderiam influenciar as vendas. Para ajustar o modelo de regressão linear múltipla, ele precisa calcular corretamente a variância dos erros do modelo, respeitando os princípios da teoria estatística para modelos com múltiplos preditores. Considerando que um analista ajustou um modelo de regressão múltipla de primeira ordem com  preditores e trabalhou com  observações, sendo que a soma dos quadrados dos resíduos (SQE) encontrada foi de .


Com base nisso, assinale a alternativa que contém a variância estimada para o modelo descrito.

A

B

C

D

E

#7

A inferência em regressão múltipla envolve avaliar a significância e o impacto dos fatores incluídos no modelo em relação ao resultado estudado. Esse processo permite verificar se as associações observadas são estatisticamente significativas e, portanto, se podem ser generalizadas para uma população mais ampla.

Com relação a este contexto e do conteúdo estudado sobre inferência em regressão múltipla, analise as asserções a seguir e a relação proposta entre elas:

I. Em inferência de regressão múltipla, um teste de hipótese para um coeficiente bi com  é usado para determinar se a variável xi adiciona informação significativa à previsão da variável dependente y, além do que já é fornecido pelos outros preditores.

PORQUE

II. Se  for rejeitada, é possível concluir que xi não contribui significativamente para o modelo, não fornecendo informações adicionais para a estimativa de y.

A respeito dessas asserções, assinale a alternativa correta:

A

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

B

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

C

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

As asserções I e II são falsas.

#8

Nos estudos sobre modelagem e inferência estatística, foram apresentados diferentes modelos de regressão múltipla, incluindo interações e preditores quadráticos. Esses modelos são fundamentais para entender como variáveis independentes influenciam uma variável dependente. Os modelos variam desde a forma mais simples até formas que incluem termos quadráticos e interações entre variáveis.

Diante disso, identifique e associe corretamente cada descrição ao tipo de modelo de regressão múltipla correspondente.
Considere que nem todos os itens das colunas podem possuir associação ou podem possuir mais de uma correlação.


Modelo de Regressão Descrições
I. Modelo de primeira ordem A. Inclui termos quadráticos e interações entre variáveis.
II. Modelo de segunda ordem sem interação B. Apenas inclui termos lineares, sem interação.
III. Modelo com preditores de primeira ordem e interação C. Inclui termos quadráticos, mas sem interação entre variáveis.
IV. Modelo quadrático completo D. Inclui termos lineares e interação entre variáveis.


Assinale a alternativa que contém a associação correta. 

A
I-A, II-C, III-B, IV-D
B
I-B, II-D, III-C, IV-A
C
I-D, II-B, III-A, IV-C
D
I-C, II-A, III-B, IV-D
E
I-B, II-C, III-D, IV-A
#9

Na análise de modelos de regressão múltipla, a inclusão de termos de interação e quadráticos pode aumentar a complexidade do modelo e melhorar o ajuste aos dados. Considere um modelo onde as variáveis explicativas são  e e o modelo inclui termos de interação e quadráticos.

Com relação a este contexto e sobre o conteúdo estudado, analise as asserções a seguir e a relação proposta entre elas:

I. A adição de termos de interação no modelo de regressão múltipla possibilita a captura das variações que uma variável explicativa exerce sobre a outra, proporcionando um ajuste mais acurado dos dados.

PORQUE

II. Modelos de regressão múltipla com termos quadráticos são apropriados para situações onde a relação entre as variáveis explicativas e a variável resposta é linear.

Comando:

A respeito dessas asserções, assinale a opção correta:

A

A asserção I é uma proposição falsa, e a II é uma proposição verdadeira.

B

As asserções I e II são proposições verdadeiras, mas a II não é uma justificativa da I.

C

A asserção I é uma proposição verdadeira, e a II é uma proposição falsa.

D

As asserções I e II são proposições verdadeiras, e a II é uma justificativa da I.

E

As asserções I e II são falsas.

#10

O coeficiente de determinação ajustado ( ajustado) é utilizado em modelos de regressão múltipla para avaliar a qualidade do ajuste do modelo. Ao comparar com o  simples, o  ajustado pode apresentar variações conforme o número de preditores incluídos no modelo, refletindo o impacto dessas variáveis na precisão do ajuste.

Com base nessas informações, assinale a alternativa que explica corretamente a importância do  ajustado.

A

O ajustado é equivalente ao R² simples em modelos de regressão múltipla com muitos preditores.

B

O ajustado é utilizado apenas em modelos com alta colinearidade entre preditores.

C

O ajustado penaliza a inclusão de variáveis preditoras irrelevantes que não melhoram o ajuste do

D

O ajustado sempre aumenta quando novos preditores são incluídos no modelo.

E

O ajustado é uma medida de ajuste irrelevante quando se compara modelos de regressão múltipla.

#11

Leia o trecho a seguir: 

Na estatística um tipo de análise é amplamente aplicada para avaliar e quantificar a relação entre uma variável dependente e diversos fatores explicativos. A análise de [preencher1] múltipla é uma técnica estatística utilizada para modelar a relação entre uma variável dependente e múltiplas variáveis independentes ou preditoras. Na fórmula geral do modelo aditivo a variável  [preencher2] representa o erro com média zero e variância constante. 

Os termos [preencher1] e [preencher2] são corretamente substituídos por:

A

1 - estimação; 2 - 

B

1 - predição; 2 - 

C

1 - regressão; 2 -

D

1 - modelagem; 2 - 

E

1 - inferência; 2 - variância

#12

A distribuição F é uma ferramenta estatística essencial, especialmente em testes como a Análise de Variância (ANOVA), onde é fundamental avaliar a comparação de variâncias entre grupos. Sua característica assimétrica e a necessidade de atenção à ordem dos graus de liberdade (numerador e denominador) tornam a distribuição F específica e rigorosa em sua aplicação. 

Com base nos assuntos estudados sobre distribuição F e interpretação de tabelas de valores críticos, assinale a alternativa correta.

A
A distribuição F é simétrica, sendo utilizada para comparar médias em testes de regressão linear, com os graus de liberdade ordenados de forma intercambiável.
B
Nos testes que utilizam a distribuição F, o valor crítico é obtido considerando qualquer ordem dos graus de liberdade, já que a distribuição é a mesma em ambas as direções.
C
A distribuição F é assimétrica à direita e utilizada em testes de Análise de Variância, deve considerar a ordem dos graus de liberdade para obter os valores críticos corretamente.
D
A tabela de distribuição F apresenta os graus de liberdade do numerador nas linhas e os do denominador nas colunas, independentemente do nível de significância.
E
A distribuição F é aplicada somente em amostras grandes, pois não exige a consideração da ordem dos graus de liberdade do numerador e denominador.
#13

Em uma pesquisa sobre a influência de infraestrutura em estabelecimentos comerciais, uma equipe de análise construiu um modelo de regressão múltipla utilizando variáveis contínuas e indicadoras. A partir dos dados coletados, calcular o valor esperado da variável resposta tornou-se essencial para projetar futuros investimentos.

Considere que o modelo de regressão linear múltipla ajustado para um conjunto de dados de estabelecimentos seja dado por:

onde:

-  representa o faturamento mensal em milhares de reais,

- ​ é o número de lojas concorrentes num raio de 1 km,

- ​ é a população no raio de 1 km (em milhares),

- ​ é uma variável indicadora (1 se possuir serviço de entrega expressa, 0 caso contrário).

Calcule o valor esperado de  para um estabelecimento que possui  lojas concorrentes, que está localizado em uma área com  mil habitantes e oferece serviço de entrega expressa.

A

B

C

D

E

#14

Compreender os componentes básicos de um modelo de regressão múltipla é essencial para interpretar os resultados e aplicar a técnica em diferentes contextos. Considere um estudo onde a satisfação no trabalho é prevista a partir de variáveis como salário, ambiente de trabalho e carga horária.

Neste contexto, assinale a alternativa que apresenta os componentes de um modelo de regressão múltipla.

A
Utiliza apenas uma variável independente.
B
É aplicado apenas em experimentos com uma variável independente.
C
Não considera a significância dos coeficientes.
D
Assume que todas as variáveis independentes são constantes.
E
Inclui múltiplas variáveis independentes para prever a variável dependente.
#15

Leia o trecho a seguir:

Na regressão múltipla, a distribuição T é frequentemente utilizada para realizar testes de hipóteses sobre os coeficientes de regressão. Esta prática é importante para determinar a significância de cada preditor no modelo. Compreender a aplicação da distribuição T na regressão múltipla é fundamental para a correta interpretação dos resultados. Neste contexto, a distribuição T é usada para [preencher 1] de cada coeficiente de regressão e considera os(as) [preencher] 2 na análise.

 

Os termos [preencher 1] e [preencher 2] são corretamente substituídos por:

A
1 prever valores - 2 constantes do modelo
B
1 ajustar o modelo - 2 coeficientes de determinação
C
1 testar a significância - 2 graus de liberdade
D
1 calcular a média - 2 variáveis independentes
E
1 estimar variáveis - 2 intervalos de confiança
#16

Em estudos estatísticos, avaliar o ajuste de um modelo de regressão múltipla é fundamental para validar suas previsões. Um dos indicadores utilizados é o erro padrão da estimativa, que mede a dispersão dos resíduos em torno da linha ajustada. Esse valor é diretamente relacionado à variabilidade que não foi explicada pelo modelo.

Com relação a este tema e aos cálculos realizados neste contexto, analise as afirmativas a seguir:

I. O erro padrão da estimativa é obtido pela raiz quadrada da divisão da soma dos quadrados dos erros (SSE) pelo número de observações .

II. No cálculo do erro padrão da estimativa em regressão múltipla, é necessário subtrair o número de preditores e o intercepto de  para obter os graus de liberdade corretos.

III. Se o erro padrão da estimativa for pequeno, indica que o modelo ajustado descreve bem os dados observados.

Está correto o que se afirma em:

A

II e III, apenas.

B

I, apenas.

C

I e II, apenas.

D

I, II e III.

E

I e III, apenas.

#17 Gabarito sob contestação

A aplicação de modelos estatísticos permite aos pesquisadores realizar previsões e análises mais precisas em diferentes áreas do conhecimento. Em situações experimentais, a construção de equações de regressão múltipla possibilita identificar padrões entre variáveis independentes e a variável resposta. Entender como essas variáveis interagem e impactam os resultados é essencial para a interpretação correta dos fenômenos observados.

Durante o estudo da influência de condições experimentais sobre a área de superfície de um catalisador, um pesquisador desenvolveu um modelo de regressão de primeira ordem com interação.

A equação ajustada para prever a variável resposta  foi expressa por:

em que ​ é o número de mols de cobalto,  é a temperatura de calcinação (em graus Celsius) e ​.

Sabendo que para um experimento realizado com  mols de cobalto e  graus de temperatura, o valor observado de  foi , complete corretamente:

O valor esperado da área de superfície, , para essas condições é [preencher 1]. O valor do resíduo para essas condições é [preencher 2].

Neste contexto, identifique os termos [preencher 1] e [preencher 2] que são substituídos por:

A

1 - 47,00; 2 - 5,00

B

1 - 52,00; 2 - 0,00

C

1 - 50,00; 2 - 2,00

D

1 - 48,31; 2 - 3,59

E

1 - 48,31; 2 - 3,69

#18

Os modelos de regressão múltipla são ferramentas essenciais para investigar relações entre variáveis em diferentes áreas do conhecimento. A interpretação adequada dos coeficientes permite compreender como cada variável contribui para o comportamento da variável resposta. Análises cuidadosas exigem que cada coeficiente seja interpretado sob condições específicas de controle das demais variáveis.

Durante um estudo de eficiência industrial, os pesquisadores desenvolveram um modelo de regressão para prever o consumo de energia em função do número de horas trabalhadas, do custo com materiais e do número de funcionários. O modelo é ajustado a partir de uma amostra de 50 empresas.

Com relação a este tema e às interpretações dos coeficientes neste contexto de regressão múltipla, analise as afirmativas a seguir:

I. O coeficiente associado a uma variável representa a variação esperada em  para um aumento de uma unidade nessa variável, mantendo-se as outras constantes.

II. Um coeficiente positivo indica que o aumento da variável está associado a uma redução na variável resposta.

III. A interpretação correta dos coeficientes requer que se assumam constantes todas as demais variáveis no modelo.

Está correto o que se afirma em:

A

I, apenas.

B

II e III, apenas.

C

I e II, apenas.

D

I e III, apenas.

E

I, II e III.

#19

A análise de resíduos e a interpretação de coeficientes em modelos de regressão múltipla são fundamentais para avaliar a qualidade de um modelo estatístico. O resíduo mede a diferença entre os valores observados e os valores previstos pelo modelo, fornecendo uma indicação do erro de previsão e permitindo a identificação de possíveis padrões não capturados pela regressão.

Com base nos assuntos estudados sobre análise de resíduos e interpretação em regressão múltipla, interprete as afirmativas a seguir:

I. Em um modelo de regressão múltipla, o cálculo do resíduo envolve subtrair o valor observado do valor esperado, sendo este último obtido pela substituição das variáveis independentes nos coeficientes da reta de regressão.

II. Em modelos com interação entre preditores, é apropriado concluir que a variação de uma variável independente isoladamente influencia diretamente a variável dependente, sem afetar os demais preditores.

III. O teste F é utilizado para verificar a utilidade do modelo de regressão múltipla, onde a hipótese nula assume que todos os coeficientes dos preditores são iguais a zero, indicando que o modelo não possui relação linear útil.

IV. Em um modelo de regressão múltipla linear, é possível inferir que cada coeficiente representa a alteração média na variável dependente quando a respectiva variável independente é incrementada em uma unidade, mantendo-se as demais constantes.

É correto o que se afirma em:

A
III e IV, apenas.
B
II e IV, apenas.
C
I, III e IV, apenas.
D
I e IV, apenas.
E
I, II, III e IV.
#20

Ao realizar a análise de um modelo de regressão múltipla, um pesquisador deseja verificar se o conjunto de variáveis independentes realmente explica a variação observada na variável dependente. Para isso, ele emprega o teste de hipótese utilizando a distribuição , a partir dos resultados obtidos com o coeficiente de determinação . Em um estudo envolvendo  observações e  preditores, o valor do coeficiente de determinação  encontrado foi de .

Sabendo que o nível de significância é  e que o valor crítico de  para os graus de liberdade correspondentes é aproximadamente , determine a estatística de teste  para o modelo e verifique se a hipótese nula deve ser rejeitada.

Em seguida, assinale a alternativa que contém o valor da estatística  e a conclusão sobre a hipótese nula.

A

, rejeita a hipótese nula.

B

, não rejeita a hipótese nula.

C

, não rejeita a hipótese nula.

D

, rejeita a hipótese nula.

E

, rejeita a hipótese nula.