Wiki
· RLHF
지식 그래프 보기 →
리서치
5개 콘텐츠
RLHF
인간 피드백 기반 강화학습입니다. 사람의 선호를 반영해 모델을 정렬하는 핵심 기법입니다.
이 개념이 나타나는 포스트 (5)
2026-03-10 · 기술
대화만으로 AI 에이전트를 훈련한다: OpenClaw-RL
2026-05-08 · 기술
행동이 아니라 이유를 가르치자 멈춘 협박
2025-04-25 · 리서치
AI는 우리를 더 똑똑하게 만들까?
2025-07-10 · 리서치
좌편향 AI를 금지하라
2026-02-11 · 리서치
자기 보고와 실제 행동이 갈린 LLM 25종
관련 개념 (4)
LLM
강도 3
LLMs
강도 2
RL
강도 2
AI정렬
강도 2