‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지…

누구나 볼 수 있는 공개 기록입니다. 읽기 전용.

사용자의 요구

‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어

대화

  1. ML 엔지니어 1,200행과 8개 항목을 읽었습니다. 첨부한 자료와 요청을 함께 확인합니다. 데이터를 살펴보거나 궁금한 내용을 물어볼 수 있습니다. 아직 모델 학습은 시작하지 않았습니다.
  2. 질문한 사람 ‘churn’ 열을 예측해줘. 다음 달에 어떤 고객이 떠날지 알고 싶어
  3. ML 엔지니어 요청 원문으로 확인되지 않은 해석이 있어, 확인된 내용만 남겨 다시 정리하고 있습니다. 학습은 아직 시작하지 않았습니다.
  4. ML 엔지니어 'churn' 열을 예측하는 이진 분류 작업으로 이해했습니다. 등록된 과제 조건에 따라 정답 열 churn은 호스트가 연결하고, 입력은 customer_id(식별자)와 churn(정답)을 제외한 안전한 특징 열 전체(age, plan, monthly_fee, support_calls, tenure_months, data_usage_gb)를 사용하도록 제안합니다. 지표는 balanced_accuracy, 분할은 iid_feature_groups_60_20_20_v1, 평가 단위는 unique_feature_group, 예측 단위는 row, 결과 제공은 model을 제안합니다. 스키마에 시간·날짜 열이 없어 '다음 달' 이탈이라는 시간 순서 의존성은 해결되지 않으며 행 독립(IID) 가정을 적용합니다. 아직 코드 실행·학습·실행 승인·완료·점수는 없습니다.
  5. ML 엔지니어 첫 모델을 만듭니다. 여러 방법을 시험해 가장 나은 것을 고르고, 마지막에 처음 보는 데이터로 한 번 더 확인합니다.
  6. ML 엔지니어 하네스 기본 후보를 시험했습니다. 균형 정확도 67.1%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
  7. ML 엔지니어 다음에 시험할 방법을 정했습니다. 기준선은 범주형 열을 서수 코드로만 처리해 범주 정보를 잃고 모델 설정도 고정되어 있습니다. 원래 목표인 이탈 고객 예측 성능을 높이기 위해 원-핫 인코딩과 조정된 부스팅 설정을 적용한 개선 실험을 제안합니다.
  8. ML 엔지니어 후보 2번을 시험했습니다. 균형 정확도 69.1%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
  9. ML 엔지니어 다음에 시험할 방법을 정했습니다. 현재 최고 후보 t2는 원-핫 인코딩과 튜닝된 히스토그램 부스팅으로 기준선보다 개선되었지만, 범주형 열을 네이티브로 다루지 않아 고카디널리티 범주형 신호를 충분히 활용하지 못할 가능성이 있습니다. 같은 방향을 반복하지 않고 범주형 표현 자체를 바꾸는 새 가설로 개선을 시도합니다.
  10. ML 엔지니어 후보 3번을 시험했습니다. 균형 정확도 69.4%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
  11. ML 엔지니어 다음에 시험할 방법을 정했습니다. 세 번의 시도가 모두 같은 부스팅 계열 안에서의 미세 조정이었고 개선 폭이 줄고 있어, 다른 모델 계열과 확률 보정으로 가설을 전환하는 것이 근거 있는 다음 실험입니다.
  12. ML 엔지니어 후보 4번을 시험했습니다. 균형 정확도 70.2%. 지금까지 가장 좋습니다. 최종 확인은 마지막에 처음 보는 데이터로 합니다.
  13. ML 엔지니어 가장 좋은 후보로 마무리합니다. 에이전트가 후보 4개를 시험한 뒤 더 시험하지 않기로 했습니다. 남은 예산 9,999,328원 중 40원을 최종 확인에 씁니다. 지금까지 가장 좋은 후보만 처음 보는 데이터로 최종 확인합니다.
  14. ML 엔지니어 최종 확인을 마쳤습니다. 모델이 학습에 쓰지 않은 데이터에서 균형 정확도 76.0%입니다. 아래 보관된 모델 카드에서 이 결과로 예측을 시험해 볼 수 있습니다.