분류 전체보기 28

[python] 브루잉일지 02. 한 잔을 내리기 전: 전처리와 변수 만들기

missing_count = df.isnull().sum()missing_percent = (missing_count / len(df)) * 100missing_summary = pd.DataFrame({ '결측치 개수': missing_count, '결측치 비율(%)': missing_percent})missing_summary = missing_summary[missing_summary['결측치 개수'] > 0].sort_values( '결측치 비율(%)', ascending=False)print(missing_summary) 3개의 데이터셋애 대해 각각 결측치를 확인했다. 모든 컬럼을 처리하지는 않고, 실제로 분석에 쓸 컬럼에 대해서만 의미 있게 채우거나 버리기로 했다. 결측치 ..

☕️ coffee lab 2026.08.02

관측일지 03. 데이터를 보기 전에 질문부터 설계하기

이벤트 설계가 필요한 이유GA4는 검색만 잘한다고 모든 걸 알아서 잘 깔끔하게 분석해주는 도구가 아닙니다. `page_view`, `scroll` 같은 이벤트는 GA4가 자동으로 수집해주지만 '회원가입 과정 중 어디서 이탈하는지', '게시글 작성을 몇 명이나 끝까지 마치는지' 같은 질문에 답하기 위해서는 그 서비스에서만 존재하는 행동을 GA4가 이해할 수 있는 형태로 미리 정의해서 코드에 심어둬야 합니다. 선 질문 후 이벤트그렇기에 이벤트 설계는 이벤트 이름부터 정하는 게 아니라 풀고 싶은 질문과 사용자 행동 흐름을 먼저 정의한 뒤 그 가설을 검증할 이벤트를 결정하는 순서로 진행해야 합니다. 질문 없이 이벤트부터 설계하면 방향성 없이 '일단 다 찍어보자' 식으로 태깅하게 되고 결과적으로 정작 필요한..

🔭 observatory 2026.07.30

관측일지 02. GA4 화면에서 길을 잃지 않는 법

GA4에 들어가면 왼쪽 사이드바에 큰 탭이 있어요. 각 탭 안에서는 뭘 할 수 있는지 하위 메뉴 단위로 하나씩 뜯어볼게요. 홈최근에 본 보고서랑 GA4가 추천해주는 카드들이 모여있는 곳입니다. 깊게 파고드는 용도라기보다는 로그인했을 때 요즘 상황을 보는 정도로 쓰이는 화면입니다. 보고서획득: 사람들이 어디서 들어왔는지참여도: 들어와서 뭘 했는지수익창출: 돈을 썼는지리텐션: 다시 왔는지이미 정해진 틀 안에서 데이터를 보는 곳입니다. 위와 같이 카테고리가 나뉘어 있고, 각 카테고리 안에 더 세부적인 리스트들이 있어요. 정해직 양식이라 빠르게 훑어보기엔 좋지만 내가 원하는 조합으로 자유롭게 보기엔 어렵습니다. 탐색보고서가 차려진 밥상이라면, 탐색은 직접 재료를 골라서 차려먹는 곳입니다. 측정기준과 측정..

🔭 observatory 2026.07.28

[python] 브루잉일지 01. 좋은 커피는 어떻게 만들어질까: 질문부터 내리기

가설번호질문가설H1고도가 높을수록 산미가 높아질까?원두의 평균 고도(`altitude_mean_meters`)가 높아질수록 산미 점수(`Acidity`)도 높아질 것이다.H2생산국이나 품종도 영향을 미칠까?생산국(`Country of Origin`)과 품종(`Variety`)에 따라 품질점수(`Total Cup Points`)에 유의한 차이가 있을 것이다.H3로스팅 정도에 따라 원두 가격은 달라질까?로스팅 정도(`roast`)에 따라 원두 가격(100g당 가격)에 유의한 치아기 있을 것이다.H3'가공 방식(워시드, 네추럴, 허니 등)에 따라 원두 가격은 달라질까?리뷰 텍스트에서 추출한 가공 방식(washed, natural, honey 등)에 따라 원두 가격(100g당 가격)에 유의한 차이가 있을 것이다..

☕️ coffee lab 2026.07.28

관측일지 01. 왜 조회수만 보면 안 될까?

GA4를 공부하게 된 이유솔직히 GA4라는 이름, 어디선가 한 번쯤을 들어보셨을 거예요. 구글에서 관련 자격증까지 만들었고, 서점에 가도 GA4를 다루는 책이 꽤 여러 권 꽂혀 있어요. 근데 막상 "그래서 이게 뭔데?"라고 물으면 딱 떨어지게 대답하기가 쉽지 않습니다. "그 외 그거 있잖아 이탈율" 이것 말고는 딱히 GA4를 표현할 말을 찾지 못했어요. 그래서 궁금해졌습니다. 이 GA4라는 건 대체 누구고, 왜 다들 공부하라고 하는걸까? 그리고 이걸 배우면 실질적으로 어떠한 것을 할 수 있을까? 이 질문에 답을 찾아가는 과정을 하나씩 기록해보려고 합니다. 관측일지는 GA4에 대해서 알아본 뒤 애널리틱스 데모 계정을 통해 시도해보고, 미리 이 블로그에 심어둔 GA4를 분석하는 순서로 진행 될 예정입니다...

🔭 observatory 2026.07.27

KB국민은행 IT부문 하계 체험형 인턴십 지원 후기 | AI 면접 KB다움

어쩌다 KB국민은행에 지원하게 되었을까사실 KB국민은행에서 인턴을 뽑는 줄도 몰랐다. 부트캠프 매니저님께서 “한 번 경험 삼아 지원해보세요.”라고 추천해 주셨고, 마침 그렇게 바쁜 시기도 아니어서 한 번 시도해보기로 했다. 그런데 문제가 하나 있긴 했다. 고등학교 3학년 때의 나는 글쓰기에 정말 재능이 1도 없다는 사실을 깨달았고, 당시에는 지금처럼 AI가 글을 함께 다듬어주는 시대도 아니었다. 그래서 자기소개서가 필요했던 학생부종합전형에는 아예 지원하지 않았다. 전공을 컴퓨터로 정한 뒤에도 긴 글을 작성할 일은 거의 없었다. 프로그래밍을 배웠으니 코드를 설명하는 문서나 프로젝트 기록은 작성했지만, 나 자신을 800자나 1,200자 안에 녹여내는 글은 처음이었다. 개발자를 준비하면서도 자기소개서보다는 포..

📂 archive 2026.07.25

정신없던 두 달, 새싹 중간평가까지

지금까지 있었던 일새싹을 시작하면서 다짐한 게 하나 있었다. 이번에는 기술 블로그를 다시 꾸준히 해보자. 그래서 새싹 2주 차 즈음에 블로그를 만들고 글도 하나 둘 작성하기 시작했다. 그런데 정신 차려보니 중간평가가 끝난 지도 벌써 2주가 넘어가고 있다. 물론 TIL이나 WIL을 작성할 생각이 없긴 했다. 그렇다고 두 달 동안 새싹 이야기를 하나도 안 적을 생각도 아니었는데, 블로그에 중간중간 들어오긴 했어도 이 정도면 새싹 다니는 줄도 모를 것 같았다. 그래서 늦었지만 그동안 있었던 이야기를 한 번 정리해보려고 한다. 2주차부터 지금까지 정말 많은 일들이 있었다. 가장 먼저 있었던 일은 노로바이러스. 새싹 4주차 즈음에 갑자기 노로바이러스에 걸려서 일주일 동안 수업을 통째로 쉬게 됐다. 굴도 안 먹..

🌱 sesac 2026.07.25

[python] 브루잉 일지 00. 왜 나는 커피를 데이터로 보기 시작했을까?

프로젝트를 시작한 이유커피를 공부하면서 '고도가 높을수록 산미가 좋다', '가공 방식에 따라 맛이 달라진다' 같은 이야기를 자주 접했다. 그럴듯하게 들리지만 실제 데이터에서도 확인되는 이야기인지는 아무도 알려주지 않았다.그래서 첫 번째 데이터 분석 프로젝트의 주제를 이 질문으로 시작하기로 했다. 막연한 궁금증을 데이터로 검증하는 과정을 한 번은 직접 경험해보고 싶었다. 질문좋은 커피는 어떻게 만들어질까? 전문가가 평가하는 좋은 커피와 소비자가 생각하는 좋은 커피는 같은 기준일까?이 질문에 대해서 생산, 가공, 소비의 세 단계로 나눠서 살펴보려고 한다.생산고도가 높을수록 산미가 높아질까?생산국이나 품종도 영향을 미칠까?가공가공 방식에 따라 원두 가격은 달라질까?가공 방식에 따라 품질 평가도 달라질까?소비..

☕️ coffee lab 2026.07.24

[python] 두 항해를 마치며....

새싹에서 데이터 분석 수업을 들으면서 이상한 갈증이 있었어요. 강의는 계속 듣는데 뭔가 하나 제대로 끝낸 게 없다는 느낌이었어요. input은 계속 쌓이는데 output은 없으니까 그래서 나 뭐 할 줄 아는데?라는 질문에 딱히 보여줄 게 없더라고요.그럴 때 걸려든 게 타이타닉 데이터였습니다. 00편에서도 적었듯 데이터 분석 입문자들에게는 거의 필수 코스처럼 쓰이는 유명한 데이터셋이었죠. 어차피 배우는 김에 처음부터 끝까지 한 번 제대로 끝내보자 싶어서 도구를 익히는 항해일지와 실제로 가설을 세우고 검증하는 탐사일지로 나눠서 쓰기 시작했습니다. 겸사겸사 블로그에도 올려보기로 했어요. 누구 하나는 도움받겠지 하는 마음도 있었습니다.지금 와서 생각해보면 이 시도는 잘한 것 같아요. 열두 편이 넘는 글을 쓰는 ..

🚢 titanic 2026.07.16

[python] 탐사일지 05. 항해도를 완성하다: 교차검증, 변수 선택, 결론과 한계

다변량 교차검증가설을 하나씩 따로 검증하면 놓치는 부분이 있어요. 변수들이 서로 얽혀 있을 때는 여러 변수를 동시에 높고 봐야 진짜 그림이 보입니다. 우리가 가설검정에 가장 중요한 변수 두 개를 객실 등급과 성별이라고 했죠? 이 부분을 좀 봐야겠어요. pivot = df.pivot_table(values="survived", index="pclass", columns="sex", aggfunc="mean")print(pivot.round(3))"""sex female malepclass 1 0.968 0.3692 0.921 0.1573 0.500 0.135""" 더보기pivot_pct = ( pivot.mul(100..

🚢 titanic 2026.07.16