Wiki
· RLHF
지식 그래프 보기 →
리서치
6개 콘텐츠
RLHF
인간 피드백 기반 강화학습입니다. 사람의 선호를 반영해 모델을 정렬하는 핵심 기법입니다.
이 개념이 나타나는 포스트 (6)
2026-03-10 · 기술
대화만으로 AI 에이전트를 훈련한다: OpenClaw-RL
2026-04-07 · 리서치
AI가 말하는 것과 행동하는 것은 다르다
2026-05-08 · 기술
Claude에게 '왜'를 가르쳤더니 협박을 멈췄습니다
2025-04-25 · 리서치
AI는 우리를 더 똑똑하게 만들까?
2025-07-10 · 리서치
좌편향 AI를 금지하라
2026-02-11 · 리서치
AI가 말하는 것과 행동하는 것은 다르다
관련 개념 (4)
LLM
강도 4
LLMs
강도 3
RL
강도 2
AI정렬
강도 2