R e RStudio

Fazer uma análise estatística completa usando RStudio pode ser um processo complexo e abrangente.  A análise estatística é um campo vasto, com muitas técnicas e métodos diferentes disponíveis. 

A escolha das técnicas corretas dependerá do seu conjunto de dados, das perguntas de pesquisa e dos objetivos da análise. Consultar a documentação dos pacotes e recursos adicionais de estatística pode ser útil para aprofundar-se em análises mais avançadas. Na parte I, focaremos na estatística descritiva dos dados. 

 

Importando dados

Para este estudo, utilizaremos os conjuntos de dados mtcars e meusdados que será criado utilizando números e letras aleatórios

 

Medidas de Tendência Central

As medidas de tendência central ou posição são ferramentas que resumem um conjunto de dados observados em um único valor representativo da variável em análise. Geralmente, uma das seguintes medidas de tendência central é usada: média, mediana ou moda.

Media aritmética

A média aritmética simples é a medida mais comum de tendência central para resumir conjuntos de dados, calculada como a soma das observações dividida pelo número delas.

Podemos explorar as estatísticas descritivas básicas com a função apply ou tapply:

Mediana

A mediana é o valor central de um conjunto de dados ordenados. Quando há um número ímpar de observações, a mediana é a observação central; com um número par, é a média das duas observações centrais.

Podemos explorar as estatísticas descritivas básicas com a função apply ou tapply:

Interpretações da média e mediana

Quando a média é significativamente diferente da mediana, isso geralmente indica que a distribuição dos dados está inclinada ou assimétrica. Aqui estão algumas interpretações comuns:

Média maior do que a mediana: Isso sugere que a distribuição dos dados é assimétrica positiva (à direita). Isso significa que existem valores extremamente altos que estão puxando a média para cima, enquanto a mediana permanece mais próxima dos valores centrais. Exemplos disso podem ser encontrados em distribuições de renda, onde algumas pessoas têm rendas muito altas, distorcendo a média.

Média menor do que a mediana: Nesse caso, a distribuição dos dados é assimétrica negativa (à esquerda). Valores extremamente baixos puxam a média para baixo, enquanto a mediana permanece mais próxima dos valores centrais. Um exemplo pode ser uma classe de estudantes, onde a maioria das notas é alta, mas alguns alunos obtiveram pontuações muito baixas.

A mediana é menos sensível a valores extremos porque não leva em consideração o valor exato desses extremos, apenas sua posição no conjunto ordenado de dados. Em contraste, a média considera todos os valores, o que a torna mais sensível a valores extremos.

Quanto à média truncada, o uso do argumento trim na função mean permite calcular a média excluindo uma porcentagem especificada dos valores extremos, ajudando a reduzir o impacto desses valores na média. Isso pode ser útil quando você deseja obter uma medida mais robusta da tendência central, especialmente em dados com valores atípicos ou extremos.

O trim retira do cálculo da média os valores extremos com o corte definido pelo fator estipulado a partir das observações extremas. Nesse caso, retiramos 10% dos maiores valores e 10% dos menores. Como a média é muito sensível a valores extremos, se houver algum valor muito grande ou pequeno em relação ao resto, a média truncada seria bem diferente da média com todos os dados.

Quantis

Os quantis são uma maneira útil de entender como os valores estão distribuídos em um conjunto de dados. Eles dividem os dados em quatro partes iguais depois de serem ordenados. O primeiro quartil (Q1) marca o limite entre os 25% menores valores e os 75% maiores valores. O segundo quartil (Q2) é a mediana, que separa os dados em duas partes iguais, com 50% abaixo e 50% acima. O terceiro quartil (Q3) é o limite entre os 75% menores valores e os 25% maiores valores.

Ao usar a função summary em um vetor de dados numéricos, você obtém uma visão rápida desses valores, incluindo o mínimo, o primeiro quartil, a mediana (segundo quartil), o terceiro quartil e o máximo. Isso é útil para entender a distribuição dos dados, identificar possíveis valores atípicos e verificar a simetria da distribuição.

Se os quartis estiverem igualmente espaçados, isso sugere uma distribuição simétrica. Se, por outro lado, os quartis estiverem deslocados em relação à mediana, isso pode indicar uma distribuição assimétrica. Essas informações ajudam os analistas de dados a ter uma compreensão mais completa da natureza dos dados com os quais estão trabalhando.

Moda

A moda de um conjunto de valores é o valor que ocorre com mais frequência. Se dois valores têm a mesma frequência máxima, o conjunto é chamado de bimodal. Se mais de dois valores têm a mesma frequência máxima, o conjunto é multimodal. Quando nenhum valor se repete, o conjunto não tem moda (é amodal). É possível calcular a moda, mesmo para variáveis qualitativas.

Máximo e mínimo

Máximo maior valor observado no conjunto de dados e mínimo é o menor valor.

Máximo maior valor observado no conjunto de dados e mínimo é o menor valor.

Medidas de dispersão

As medidas de dispersão são usadas para avaliar o quanto os dados estão espalhados ou afastados em relação ao valor médio (ou medida de tendência central). Elas fornecem informações importantes sobre a variabilidade ou a dispersão dos dados em um conjunto. Algumas das medidas de dispersão mais comuns incluem:

Amplitude

A diferença entre o maior e o menor valor em um conjunto de dados. É uma medida simples de dispersão, mas pode ser sensível a valores extremos.

Variância

Uma medida que avalia o quão distantes os valores individuais estão da média. Ela leva em consideração todos os valores no conjunto e é mais robusta contra valores extremos.

Desvio Padrão

A raiz quadrada da variância. Ele também fornece uma medida da dispersão dos dados, mas está na mesma unidade de medida dos dados originais, tornando-o mais interpretável. É uma medida descritiva geralmente usada com a média. 

Intervalo Interquartil (IQR)

A diferença entre o terceiro quartil (Q3) e o primeiro quartil (Q1) de um conjunto de dados ordenados. O IQR é útil para avaliar a dispersão dos valores centrais e é menos afetado por valores extremos. É uma medida descritiva geralmente usada com a mediana. 

Coeficiente de Variação (CV)

Uma medida relativa de dispersão que expressa a variabilidade como uma porcentagem da média. É útil para comparar a dispersão em conjuntos de dados com diferentes escalas.

Essas medidas de dispersão ajudam os analistas de dados a entender a variabilidade intrínseca nos dados, identificar valores atípicos e avaliar a consistência ou a dispersão dos dados em relação à média.

Quarteto de Anscombe

Este conjunto de dados é composto de 4 pares de variáveis, nomeadas x1 a x4 (variáveis independentes ou preditoras) e y1 a y4 (variáveis dependentes ou resposta). Abaixo, esses dados serão explorados e o output demonstrado. Atente-se as interpretações que podem ser feitas a partir dos resultados de cada análise:

Comparando as médias das variáveis do objeto anscombe:

Agora, observando as variâncias:

A questão central para este conjunto de dados é determinar se existe uma relação entre cada variável x e y. Essa relação pode ser avaliada usando o coeficiente de correlação de Pearson, que varia de zero (indicando nenhuma correlação) a um (indicando uma correlação perfeita, seja positiva ou negativa).

O código acima pode ser aplicado através da função with que facilita a digitação das variáveis:

Outra maneira de avaliar a relação é com os coeficientes da reta de um modelo linear entre as duas variáveis. Essa relação é obtida pela função coef aplicada ao um objeto de modelo linear. Vamos avaliar esse coeficientes para os quatro conjuntos de variáveis:

Todos os coeficientes estão muito próximos a 3.00 e 0.50. Vamos criar os gráficos de dispersão entre as variáveis x e y para os quatro casos e vamos incluir a relação linear para cada par com a função abline. Nossa única inclusão no plot foram os argumentos xlim e ylim para que todos os gráficos tenham as mesmas escalas nos eixos:

Gráficos de dispersão com relação linear dos dados anscombe

Este conjunto de dados foi criado por Frank Anscombe, um estatístico renomado, com o propósito de destacar a importância da análise visual de dados, conforme pode ser visto aqui. Durante nossa análise exploratória não gráfica, notamos que as médias, desvios-padrão, correlações e coeficientes de regressão são praticamente idênticos para os quatro conjuntos de dados, sugerindo que eles são semelhantes em termos estatísticos. No entanto, é notável como eles diferem substancialmente em termos visuais e de interpretação:

  • O primeiro conjunto de dados parece seguir as suposições dos modelos lineares, mostrando uma relação linear entre as variáveis.
  • O segundo conjunto de dados exibe uma clara relação não linear entre as variáveis.
  • O terceiro conjunto de dados possui um valor atípico influente que afeta a inclinação da relação e introduz uma heterogeneidade na variância.
  • O quarto conjunto de dados também possui um ponto atípico de alta alavancagem que é crítico para a relação entre as variáveis; caso seja removido da amostra, as variáveis y4 em função de x4 não apresentarão mais nenhuma relação aparente.

Essas observações enfatizam a importância de não depender apenas de estatísticas resumidas e ressaltam como a análise visual pode revelar informações cruciais sobre os dados.

Acesse a sessão gráficos neste site e aprenda como explorar visualmente seus dados!

Exercícios

A- Utilizando os dados mtcars calcule a média e a mediana das seguintes variáveis: “mpg” “cyl” “disp” “hp” “drat”.

B- Descubra a moda da variável “qsec” e “vs” em mtcars.

C- Calcule a amplitude da variável “carb” em mtcars.

d- Descubra a correlação e represente graficamente considerando 8 variáveis de mtcars (semelhante ao que foi demonstrado com Anscombe). 

Comentários

{{ reviewsTotal }}{{ options.labels.singularReviewCountLabel }}
{{ reviewsTotal }}{{ options.labels.pluralReviewCountLabel }}
{{ options.labels.newReviewButton }}
{{ userData.canReview.message }}

R: Bioestatística