Importante

Você está vendo a versão anterior da nova experiência da Alura que estamos preparando para você. Em breve, ela ganha uma identidade visual novinha totalmente pensada em potencializar seus estudos!

1
resposta

[Dúvida] Dado fora da linha de regressão

Como eu consigo identificar o dado maior que 1 na linha de regressão, na aula foi mostrado o dado na linha, mas não sei puxar esta informação de maneira descrita e não grafica.

1 resposta

Boa tarde, Aline! Tudo bem?

Vou trazer uma abordagem que pode te ajudar!

Para identificar dados que estão fora da linha de regressão de forma numérica, sem usar gráficos, você pode calcular a diferença entre os valores reais e os valores preditos pelo modelo. Essa diferença é conhecida como "resíduo". Se você está procurando especificamente por dados com valores preditos maiores que 1, você pode filtrar os resultados preditos para encontrar esses casos.

Um exemplo de como você pode fazer isso em Python:

import numpy as np
import pandas as pd
from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split
from sklearn.datasets import fetch_california_housing

# Carregar o conjunto de dados
california = fetch_california_housing()
df = pd.DataFrame(california.data, columns=california.feature_names)
df['PRICE'] = california.target

# Dividir os dados em treino e teste
X = df.drop('PRICE', axis=1)
y = df['PRICE']
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)

# Treinar o modelo
model = LinearRegression()
model.fit(X_train, y_train)

# Fazer previsões
y_pred = model.predict(X_test)

# Encontrar dados com valores preditos maiores que 1
indices_maiores_que_um = np.where(y_pred > 1)[0]
dados_maiores_que_um = X_test.iloc[indices_maiores_que_um]

print("Índices dos dados com valores preditos maiores que 1:")
print(indices_maiores_que_um)
print("\nDados correspondentes:")
print(dados_maiores_que_um)

Neste exemplo, np.where(y_pred > 1)[0] retorna os índices dos dados cujos valores preditos são maiores que 1.

Em seguida, esses índices são usados para extrair os dados correspondentes do conjunto de teste X_test.

Espero ter ajudado e fico à disposição se precisar.

Abraço e bons estudos!

Caso este post tenha lhe ajudado, por favor, marcar como solucionado