KNPS 2026 — 같은 하네스로 6일 동안 140번
실험 140건 · 채택 21 · 탈락 55 · 차이 없음 57 · GPU 37.5시간 (2026-09-02 01:05 ~ 2026-09-07 11:49). 점수는 장면을 통째로 떼어 둔 3-fold 검증입니다.
기준선을 올린 실험
- r001 · 0.2203 · 출발점 — 주최측 기본 모델을 위성 밴드 3채널로 다시 학습
- r002 · 0.2268 · 장면 보정 (전부) — 새 장면의 밝기·색 통계에 모델을 완전히 맞춤 — 한 장면은 올랐지만 다른 장면이 무너짐
- r003 · 0.2391 · 장면 보정 (절반) — 절반만 맞추니 세 장면이 고르게 오름
- r007 · 0.2534 · 보정량 자동 — 장면이 얼마나 다른지 재서 보정량을 스스로 정함
- r010 · 0.2931 · 스스로 라벨 — 새 장면에서 자기가 찾은 나무를 다시 학습 재료로 씀
- r030 · 0.3042 · 세 모델 합의 — 세 모델이 동의한 나무만 학습 재료로 인정
- r039 · 0.3313 · 두 눈으로 보기 — 위성 밴드 모델과 컬러 모델을 따로 두고 결과를 합침
- r044 · 0.3420 · 교차 합의 — 두 모델이 모두 찾은 나무만 학습 재료로
- r090 · 0.3513 · 다시 채점 — 찾은 상자를 작은 심사 모델이 한 번 더 채점
- r095 · 0.3575 · 상자 다듬기 — 상자의 위치와 크기를 작은 모델이 보정
- r100 · 0.3586 · 각도 맞춤 — 정답 상자 97%가 축에 나란해서 각도를 0/90°로
- r103 · 0.3596 · 보정 3벌 평균 — 상자 보정 모델 세 벌의 평균
- r105 · 0.3614 · 가로세로 따로 — 보정 창을 가로·세로 따로 잘라 작은 축도 학습되게
하네스가 막은 것
- 랜덤 분할 점수는 착시 — 같은 모델을 행을 섞어 검증하면 0.3245, 장면을 통째로 떼어 검증하면 0.2219. 평가는 새 장면에서 하므로 하네스는 장면 단위 점수만 인정한다.
- 시드 분산 안이면 “차이 없음” — 같은 코드를 시드만 바꿔 5번 돌리면 0.2691~0.2982까지 흔들렸다. 이 폭 안의 개선은 채택하지 않는다 — 140건 중 57건이 여기서 걸렸다.
- 사전 등록한 조기 중단 — 실험을 시작할 때 “첫 장면에서 이 수치가 내려가면 멈춘다”를 적어 두고, 그대로 멈췄다 (r111: 0.4000→0.3943). 끝까지 돌려 보고 좋은 부분만 고르는 일을 막는다.
- 제출 전에 평가 서버처럼 실행 — 제출 노트북을 채점 서버와 같은 조건(장면별 자산·시간·메모리)으로 돌려 점수를 낸 뒤에야 제출 후보가 된다. 채택된 파이프라인이라도 이 단계를 거치지 않으면 제출되지 않는다.