좋은 모델 위에만 RL이 얹힌다

원본 영상: How Cursor Trained Composer on Fireworks: Distributed Infrastructure for High-Performance RL · 채널 Sequoia Capital · 구간 30:01–31:12

이 구간의 핵심

좋은 모델 위에만 RL이 얹힌다 • 온라인 RL은 '처음부터 학습'이 아니라 '마지막 다듬기'다 • 사용자에게 버틸 수준이 아니면 피드백도 얻기 어렵다 • 모델 품질이 먼저여야 RL의 선순환이 시작된다

이 영상의 요약과 다른 핵심 구간 전부 보기 →

이 구간의 핵심 정리는 인사이트컷(InsightCut)이 작성했습니다. 원본 영상의 저작권은 Sequoia Capital에게 있으며, 영상은 공식 YouTube 플레이어로 재생됩니다. 자막 전문은 게재하지 않습니다.