내용으로 건너뛰기

Out of the Box

사용자 도구

로그인

사이트 도구

최근 바뀜
미디어 관리자
사이트맵

추적:

preference

TAG: preference

2024-01 [SPO] A Minimaximalist Approach to Reinforcement Learning from Human Feedback

2024/01/11 00:20

Hyunsoo Park

문서 도구

문서 보기
이전 판
역링크
Fold/unfold all
맨 위로

별도로 명시하지 않을 경우, 이 위키의 내용은 다음 라이선스에 따라 사용할 수 있습니다: CC Attribution-Noncommercial-Share Alike 4.0 International