‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지…
누구나 볼 수 있는 공개 기록입니다. 읽기 전용.
사용자의 요구
‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어
대화
- ML 엔지니어 1,200행, 8개 항목을 읽었습니다. 답의 기준은 ‘churn’ 열로 잡았습니다. 아래에서 맞는지 확인해 주세요.
- 질문한 사람 ‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어
- ML 엔지니어 등록된 과제 조건에 따라 'churn' 열을 예측하는 계획을 세웠습니다. 입력은 허용된 전체 특징 열을 사용하고, 예측 단위는 행, 평가 단위는 특징 그룹, 지표는 balanced_accuracy, 분할은 iid_feature_groups_60_20_20_v1, 결과 제공은 model로 제안합니다. 다음 행동은 이 결정을 DECISION.json에 기록하는 것입니다.
- ML 엔지니어 첫 모델을 만듭니다. 여러 방법을 시험해 가장 나은 것을 고르고, 마지막에 처음 보는 데이터로 한 번 더 확인합니다.
- ML 엔지니어 하네스 기본 후보를 시험했습니다. 균형 정확도 67.2%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
- ML 엔지니어 다음에 시험할 방법을 정했습니다. 기준선은 범주형 열을 순서형 코드로만 처리하고 고정된 부스팅 설정을 사용합니다. 원-핫 인코딩과 용량·규제 조정으로 이탈 예측의 균형 정확도를 높일 수 있는지 검증합니다.
- ML 엔지니어 후보 2번을 시험했습니다. 균형 정확도 69.1%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
- ML 엔지니어 판단 형식을 바로잡습니다. 에이전트가 낸 판단이 형식 검증을 통과하지 못해, 무엇이 틀렸는지 알려주고 한 번 다시 쓰게 합니다.
- ML 엔지니어 다음에 시험할 방법을 정했습니다. t2의 원-핫 인코딩은 고카디널리티 범주형 열에서 희소 표현과 과적합 위험이 있고, 부스팅 용량이 커서 규제를 강화한 타깃 인코딩 실험이 다음으로 정당하다.
- ML 엔지니어 학습 코드가 실행 중 오류를 냈습니다. 기록은 남겨 두고, 고칠 수 있는 오류인지 확인합니다. 아직 점수는 없습니다.
- ML 엔지니어 에이전트가 오류를 고칩니다. 오류 내용을 보고 코드를 다시 써서 같은 조건으로 다시 시험합니다. 예산과 평가 방식은 그대로입니다.
- ML 엔지니어 학습 코드가 실행 중 오류를 냈습니다. 기록은 남겨 두고, 고칠 수 있는 오류인지 확인합니다. 아직 점수는 없습니다.
- ML 엔지니어 가장 좋은 후보로 마무리합니다. 오류 수정은 한 번까지라 시험을 멈췄습니다. 지금까지 가장 좋은 후보만 처음 보는 데이터로 최종 확인합니다.
- ML 엔지니어 최종 확인을 마쳤습니다. 모델이 학습에 쓰지 않은 데이터에서 균형 정확도 66.8%입니다. 아래 보관된 모델 카드에서 이 결과로 예측을 시험해 볼 수 있습니다.
- 질문한 사람 놓치는 고객을 더 줄여줘
- ML 엔지니어 떠나는 고객을 덜 놓치도록 개선을 시도합니다. 현재 보관된 모델은 원-핫 인코딩과 히스토그램 부스팅 조합이고, 개발 데이터 균형 정확도는 69.1%였습니다. 같은 작업에서 새 후보를 만들어 개발 데이터로만 비교하며, 최종 점수는 같은 평가 데이터를 두 번 쓰지 않도록 다시 재지 않습니다. 개선 시도를 시작했습니다. 새 후보를 만들어 개발 데이터로 비교한 뒤 결과를 여기에 알려드립니다.
- 질문한 사람 지금 어디까지 했어?
- ML 엔지니어 지금 '떠나는 고객(churn=yes)을 덜 놓치도록 범주형 인코딩과 부스팅 규제를 조정한 새 후보를 만들어 달라' 요청으로 개선 후보를 시험하고 있습니다 (최대 4개 중 1번째). 첫 후보를 준비하고 있습니다. 끝나면 결과를 여기에 알려드리고, 그 뒤에 질문에 답할 수 있습니다.
- ML 엔지니어 개선 후보 5번을 만듭니다. 요청: 떠나는 고객(churn=yes)을 덜 놓치도록 범주형 인코딩과 부스팅 규제를 조정한 새 후보를 만들어 달라
- ML 엔지니어 개선 후보 5번을 시험하지 못했습니다. 이전 후보와 같은 코드라 다시 학습하지 않았습니다.
- ML 엔지니어 개선 후보 6번을 만듭니다. 요청: 떠나는 고객(churn=yes)을 덜 놓치도록 범주형 인코딩과 부스팅 규제를 조정한 새 후보를 만들어 달라
- ML 엔지니어 개선 후보 6번을 시험하지 못했습니다. 학습 코드가 실행 중 오류를 냈습니다. 오류를 보고 한 번 고쳐 봅니다.
- ML 엔지니어 개선 후보 6번의 오류를 고칩니다. 학습 중 난 오류를 에이전트에게 보여주고 코드를 한 번 고쳐 같은 조건으로 다시 시험합니다.
- ML 엔지니어 개선 후보 7번을 시험하지 못했습니다. 이전 후보와 같은 코드라 다시 학습하지 않았습니다.
- ML 엔지니어 새 후보 3개가 모두 학습 전후에 실패해 비교할 결과가 없습니다. 기존 모델(개발 점수 69.1%)을 그대로 둡니다. 최종 점수는 원래 모델의 1회 측정값(66.8%)을 그대로 둡니다. 다른 방향으로 더 해보려면 "한 번 더 해봐"처럼 말해 주세요.
- 질문한 사람 나이 34살, basic 요금제, 월 29.9, 상담 5번, 가입 3개월 고객은 떠날까?
- ML 엔지니어 나이 34, basic 요금제, 월 29.9, 상담 5번, 가입 3개월로 읽었습니다. 보관된 모델로 직접 예측한 결과입니다 (말하지 않은 항목은 빈 값으로 넣었습니다): 1) age=34, monthly_fee=29.9, plan=basic, support_calls=5, tenure_months=3 → churn: yes