PANDAS 3

[python] 브루잉일지 02. 한 잔을 내리기 전: 전처리와 변수 만들기

missing_count = df.isnull().sum()missing_percent = (missing_count / len(df)) * 100missing_summary = pd.DataFrame({ '결측치 개수': missing_count, '결측치 비율(%)': missing_percent})missing_summary = missing_summary[missing_summary['결측치 개수'] > 0].sort_values( '결측치 비율(%)', ascending=False)print(missing_summary) 3개의 데이터셋애 대해 각각 결측치를 확인했다. 모든 컬럼을 처리하지는 않고, 실제로 분석에 쓸 컬럼에 대해서만 의미 있게 채우거나 버리기로 했다. 결측치 ..

☕️ coffee lab 2026.08.02

[python] 항해일지 02. 승객 명단 펼쳐보기: pandas

본격적으로 시작하기 전에 왜 `pandas`를 쓰는지부터 이야기를 해보도록 할게요.데이터는 보통 엑셀처럼 행과 열로 이루어진 표 형태로 존재해요. `pandas`는 이런 표 형태의 데이터를 파이썬으로 다루기 위한 도구입니다. `pandas`의 핵심 자료구조는 DataFrame인데 엑셀 시트 하나라고 생각하면 됩니다. 행과 열에 이름이 붙어있고, 각 열마다 데이터 타입이 다를 수 있어요. 타이타닉 데이터로 보자면, `survived`는 0과 1로 이루어져 있지만, `class`를 보면 First, Second, Third로 이루어져 있어요. 그렇다면 `numpy`와는 어떤 게 다를까요? `numpy`는 숫자 계산에 특화된 배열이고, `pandas`는 이름 있는 열, 결측치 처리, 그룹별 통계 같은 실제 ..

🚢 titanic 2026.06.24

[python] 항해일지 01. 엔진룸 구경하기: numpy

데이터 가져오기kaggle에서 타이타닉과 관련된 데이터를 가져왔습니다. 다운로드한 csv 파일을 `data` 폴더에 넣어주세요. 이름은 원하는 형태로 해도 좋지만 저는 `titanic`으로 하겠습니다. 라이브러리 불러오기 & 데이터 numpy 배열로 변환# [1] 라이브러리 불러오기import pandas as pdimport numpy as npdf = pd.read_csv("data/titanic.csv")# [2] 데이터를 numpy 배열로 변환age = df["age"].dropna().to_numpy()fare = df["fare"].to_numpy()survived = df["survived"].to_numpy()print(f"age[{type(age)}]: {age[:5]}")# age..

🚢 titanic 2026.06.23