DataFrame에 결측값이 있으면 평균, 합계, 모델 입력처럼 이후 연산의 결과가 달라질 수 있다. 먼저 결측값이 생긴 이유를 확인하고, 삭제해도 되는 행만 제거한다.
결측값이 있는 행 제거
df = df.dropna(axis=0)axis=0은 결측값이 포함된 행을 제거한다. 원본을 유지하려면 반환값을 새 변수에 대입한다.
이동 평균 뒤 인덱스 정리
df["mean"] = df["Close"].rolling(window=10).mean()
df = df.dropna().reset_index(drop=True)이동 평균의 첫 구간은 계산에 필요한 이전 값이 부족해 NaN이 생긴다. 행을 삭제한 뒤 인덱스도 다시 매기면 이후 반복과 병합에서 혼동을 줄일 수 있다.
특정 열만 기준으로 결측값을 검사해야 한다면 subset 인자를 사용한다. 무조건 삭제하기보다 분석 목적에 맞춰 보간이나 기본값 처리도 함께 검토한다.
댓글을 불러오고 있습니다.