기술
14개 콘텐츠
AI 안전
AI가 의도하지 않은 피해를 일으키지 않도록 하는 연구·실천입니다. 정렬·해석성·통제 등을 다룹니다.
이 개념이 나타나는 포스트 (14)
AI의 사춘기: 다리오 아모데이가 경고한 5가지 문명적 위험
AI는 왜 사람처럼 행동하는가 (멀티 페르소나)
샘 알트만, 신뢰할 수 있는가
AI가 AI 안전 연구를 합니다: 자동화 정렬 연구원의 등장
모델의 내부 활성값을 문장으로 옮기는 법
행동이 아니라 이유를 가르치자 멈춘 협박
끄는 스위치가 없는 초지능
모델의 중간 추론을 읽는 렌즈
언어에 따라 갈라지는 클로드의 가치관
하사비스가 내놓은 제3기구 규제안
딥마인드 연구원이 사표를 쓰며 남긴 기록
AI가 스스로 메운 정렬 격차 26~96%
제프리 힌튼 교수가 바라보는 AI
AI의 의도적인 거짓말