‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지…
누구나 볼 수 있는 공개 기록입니다. 읽기 전용.
사용자의 요구
‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어
대화
- ML 엔지니어 1,200행, 8개 항목을 읽었습니다. 답의 기준은 ‘churn’ 열로 잡았습니다. 아래에서 맞는지 확인해 주세요.
- 질문한 사람 ‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어
- ML 엔지니어 요청 원문으로 확인되지 않은 해석이 있어, 확인된 내용만 남겨 다시 정리하고 있습니다. 학습은 아직 시작하지 않았습니다.
- ML 엔지니어 'churn' 열을 예측하는 이진 분류 작업으로 계획합니다. 등록된 과제 조건에 따라 전체 안전 입력 열을 사용하고, 정답 열은 churn, 지표는 balanced_accuracy, 분할은 iid_feature_groups_60_20_20_v1, 평가 단위는 unique_feature_group, 예측 단위는 row, 결과 제공은 model로 제안합니다. 스키마에 시간·날짜 열이 없어 '다음 달'은 현재 분포 기준 예측으로 해석하며, 실제 시간 순서 의존성이 있으면 한계가 있습니다. 추가로 확인할 사용자 조건은 없습니다.
- ML 엔지니어 첫 모델을 만듭니다. 여러 방법을 시험해 가장 나은 것을 고르고, 마지막에 처음 보는 데이터로 한 번 더 확인합니다.
- ML 엔지니어 하네스 기본 후보를 시험했습니다. 균형 정확도 65.1%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
- ML 엔지니어 판단 형식을 바로잡습니다. 에이전트가 낸 판단이 형식 검증을 통과하지 못해, 무엇이 틀렸는지 알려주고 한 번 다시 쓰게 합니다.
- ML 엔지니어 다음에 시험할 방법을 정했습니다. 기준선은 범주형 열을 순서형 코드로만 처리하고 고정 설정을 씁니다. 원-핫 인코딩과 소규모 하이퍼파라미터 탐색으로 이탈 예측 성능을 높여보겠습니다.
- ML 엔지니어 학습 코드가 실행 중 오류를 냈습니다. 기록은 남겨 두고, 고칠 수 있는 오류인지 확인합니다. 아직 점수는 없습니다.
- ML 엔지니어 에이전트가 오류를 고칩니다. 오류 내용을 보고 코드를 다시 써서 같은 조건으로 다시 시험합니다. 예산과 평가 방식은 그대로입니다.
- ML 엔지니어 학습 코드가 실행 중 오류를 냈습니다. 기록은 남겨 두고, 고칠 수 있는 오류인지 확인합니다. 아직 점수는 없습니다.
- ML 엔지니어 가장 좋은 후보로 마무리합니다. 오류 수정은 한 번까지라 시험을 멈췄습니다. 지금까지 가장 좋은 후보만 처음 보는 데이터로 최종 확인합니다.
- ML 엔지니어 최종 확인을 마쳤습니다. 모델이 학습에 쓰지 않은 데이터에서 균형 정확도 65.2%입니다. 아래 보관된 모델 카드에서 이 결과로 예측을 시험해 볼 수 있습니다.
- 질문한 사람 놓치는 고객을 더 줄여줘
- ML 엔지니어 놓치는 고객을 줄이는 방향으로 개선을 시도합니다. 하네스가 만든 기본 모델은 범주형 열을 순서형 코드로만 다루고 고정 설정을 썼으니, 범주형 상호작용을 더 잘 살리는 인코딩과 클래스 불균형에 맞춘 조정을 시도합니다. 같은 평가 데이터를 두 번 쓰지 않도록 최종 점수는 다시 재지 않고, 새 후보는 개발 데이터로만 비교합니다. 개선 시도를 시작했습니다. 새 후보를 만들어 개발 데이터로 비교한 뒤 결과를 여기에 알려드립니다.
- ML 엔지니어 개선 후보 4번을 만듭니다. 요청: 범주형 열의 인코딩을 개선하고 클래스 불균형에 맞춘 임계값·하이퍼파라미터 조정으로 놓치는 고객(거짓 음성)을 줄이는 후보를 만들어 개발 데이터로 비교해 달라
- ML 엔지니어 개선 후보 4번을 시험했습니다. 개발 점수 62.5% (-2.6%p) · 기존 모델보다 낫지 않습니다.
- ML 엔지니어 개선 후보 5번을 만듭니다. 요청: 범주형 열의 인코딩을 개선하고 클래스 불균형에 맞춘 임계값·하이퍼파라미터 조정으로 놓치는 고객(거짓 음성)을 줄이는 후보를 만들어 개발 데이터로 비교해 달라
- ML 엔지니어 개선 후보 5번을 시험했습니다. 개발 점수 64.3% (-0.7%p) · 기존 모델보다 낫지 않습니다.
- ML 엔지니어 새 후보 2개를 시험했지만 선택된 모델의 개발 점수 65.1%보다 나은 것이 없어 기존 모델을 그대로 둡니다. 최종 점수는 원래 모델의 1회 측정값(65.2%)을 그대로 둡니다.
- 질문한 사람 나이 34살, basic 요금제, 월 29.9, 상담 5번, 가입 3개월 고객은 떠날까?
- ML 엔지니어 나이 34, basic 요금제, 월 29.9, 상담 5번, 가입 3개월로 읽었습니다. 보관된 모델로 직접 예측한 결과입니다 (말하지 않은 항목은 빈 값으로 넣었습니다): 1) age=34, monthly_fee=29.9, plan=basic, support_calls=5, tenure_months=3 → churn: yes
- 질문한 사람 개선된 모델은 뭐가 달라졌어?
- ML 엔지니어 개선 후보 2개(t4, t5)를 시험했지만 개발 점수가 각각 62.5%, 64.3%로 기존 모델의 65.1%보다 낮아, 최종적으로는 하네스가 만든 기본 모델(t1)이 그대로 선택됐습니다. 즉 개선된 모델로 바뀐 것이 아니라 기존 모델이 유지됐습니다. 참고로 최종 점수는 65.2%(균형 정확도 = 클래스별로 맞힌 비율의 평균)입니다.