Skip to content

5주차: 평가 시스템과 지표가 측정하지 못하는 것

평가 시스템과 지표가 측정하지 못하는 것

전통적 평가 지표 vs LLM 기반 평가 강의 + 감독 신호 신뢰성(teacher·LLM judge·도메인 임계값을 참값으로 승격시키지 않는다) / 학습활동 - 3주차 과제 결과를 두 방식으로 채점해 불일치 지점 기록, 정답 없이 문서만 준 judge가 오답을 승인하는 사례 1건 수집

Q4 근거 기준. 결과가 맞아도 어느 기준·어느 데이터로 판단했는지 대지 못하면 현장에서 통하지 않음. LLM 기반 평가 구현과 pass@k 대조

[이론] LLM judge의 false acceptance가 우연이 아니라 구조적인 이유. 중간 과정이 형식적으로 그럴듯하면 오답이 통과한다

[구현] pass@k를 측정하는 코드를 받아 실행하고 k 값을 바꿔가며 곡선을 그림. 학습 전 pass@k 곡선과 학습 후 pass@1을 대조해 성능 향상이 새 추론 능력인지 기존 성공 경로의 탐색 효율 개선인지 구분

[실무] 제공된 벤치마크 항목표에서 골라 소규모 도메인 벤치마크를 구성. 제주데이터허브·관광 빅데이터 플랫폼에서 확보 가능한 데이터를 대상으로 무엇을 측정할지와 그 지표가 놓치는 것을 함께 기술 〔데이터셋 실물은 개강 전 확인〕

준비 중입니다. 올라오면 이 자리에 Colab 링크가 표시됩니다.