Independent : 독립 변수, 예측변수 Dependent : 종속 변수, 예측할 변수
주로 데이터세트의 첫 번째 열에 특징이 분리되어있고 종속변수는 주로 데이터 세트의 마지막열에 있음 파이썬에서 :은 범위를 뜻하는데 :만 사용할경우 범위의 모든것을 가져오겠단 의미 이므로 모든행이 들어감
[:-1]는 마지막을 제외한 모두
Ex) aaa.iloc[:1] 여기서 [ : , ] 콤마는 분리해주는 역활로 이제 행의 범위를 지정가능
ColumnTransformer() : 첫 번째는 transformer로 어떤 열의 인덱스에 변환을 적용하고싶은지 지정하는 인자 Ex) ct = ColumnTransformer(transformers=[('encoder', OneHotEncoder(),[0])], remainder='passthrough') 두 번째는 remainder로 변환이 적용되지 않고 유지되길 원하는 열을 지정하는 인자
피쳐 스케일링 : 모든 변수나 특징을 스케일링 하는 도구 (모든 값이 같은 단위를 가지게하고 특징은 다른 하나를 지배하여 머신러닝 모델에 의해 무시되는일을 막기위함) 스케일링을 하기위해 특징의 평균과 표준 편차를 구하는기술. 피쳐 스케일링은 훈련 데이터셋과 테스트 데이터셋으로 분할한 다음 적용하어야 한다 이유 : 훈련시에는 기존 관측값으로 기계 모델을 훈련하고 검증시에는 새로운 관측값 으로 모델의 성능을 평가하기에 새로운 관측값이 미래에 갖게 될 데이터이자 미래 머신러닝 모델에 배치할 데이터 이기 때문이다. 또한 실제 작업하는 데이터세트에 검증데이터셋이 존재하면 안되는데 이때 검증데이터셋 에서 가져오면 안되는 정보를 가지고오게된다.
from sklearn.model_selection import train_test_split x_train, x_test, y_train, y_test = train_test_split(x,y, test_size = 0.2, random_state = 1) 훈련 크기는 8:2(테스트가 2) (랜덤시드를 고정하여 똑같이 분열되게 고정) 훈련과 검증 데이터셋을 분리하는 과정 특징 행렬 x,y 종속 변수 x,y 총 4개가 생성된다
StandardScaler : 훈련 세트, 테스트 세트의 특징행렬 두가지 모두를 표준화 해주는 도구 .fit_transform : 특성 행렬의 평균과 표준 편차를 구하는 'fit'과 공식을 적용해서 변환해주는 'transform'을 둘다 실행해줌
가변수 : 임시로 변환한 변수 Ex) OneHotEncoding 특성 행렬의 가변수에 특정 스케일링/표준화를 해야하는가? : 아니오. 모든 특성값을 같은 범위에 놓기 위함인데 0,1,0 같은 원핫 인코딩을 해주었을경우 이미 0과1로 이루어져 표준화를 해줄 필요가 없음 만약 표준화를 하면 3 or -3 사이의 값으로 바꾸어 말도안되는 숫자값을 갖게되며 어떤 숫자가 어떤 나라에 해당되는지 알수없음 즉 해석을 잃음 기존의 변수에만 해주면 충분함.
데이터 전처리시 순서가 중요하지 않다면 원핫 인코딩기법 주로 사용 데이터 전처리시 순서가 중요하다면 라벨인코더를 적용