지식 그래프 보기 →
리서치 6개 콘텐츠

RLHF

인간 피드백 기반 강화학습입니다. 사람의 선호를 반영해 모델을 정렬하는 핵심 기법입니다.

이 개념이 나타나는 포스트 (6)

관련 개념 (4)