10주차: 정렬 기법의 계보 - RLHF에서 GRPO까지
정렬 기법의 계보 - RLHF에서 GRPO까지
온라인 (2시수)
Section titled “온라인 (2시수)”SFT → RLHF(PPO) → DPO → GRPO 계보 강의. 각 단계가 푼 문제와 남긴 문제를 순서대로. GRPO의 group-relative advantage와 critic 제거가 무엇을 바꾸는가 / 학습활동 - 같은 프롬프트에 대한 정렬 전후 응답을 수집해 무엇이 달라졌는지 기술
대면 (1시수)
Section titled “대면 (1시수)”Q3 가치 충돌. 유용성과 안전성, 정확성과 응답 속도처럼 동시에 만족할 수 없는 목표를 어디서 절충하는가. 정렬 기법 비교 분석
[이론] PPO 목적함수에서 critic이 하는 일을 짚고, GRPO가 그것을 그룹 상대 보상으로 대체하는 과정을 수치 예로 확인. 오해 정정 3종(논문 오독 방지)을 원문 읽기 전에 확인
[구현] 준비된 GRPO 예제를 실행해, 응답 단위 보상이 전체 토큰에 동일하게 broadcast되는 과정을 숫자로 관찰
[실무] 관광 응대 상황을 상정해 유용성과 안전성의 절충 지점을 근거와 함께 제시. 잘못된 정보가 관광객에게 도달했을 때의 비용을 기준으로 어디까지 자동 응답을 허용할지 판단
실습 노트북
Section titled “실습 노트북”준비 중입니다. 올라오면 이 자리에 Colab 링크가 표시됩니다.