원본 영상: How Cursor Trained Composer on Fireworks: Distributed Infrastructure for High-Performance RL · 채널 Sequoia Capital · 구간 0:02–0:55
환경이 진짜 같아야 학습도 진짜다 • 모델은 학습 환경과 운영 환경의 차이를 금방 알아챈다 • 보상 함수가 허술하면 모델은 최적화가 아니라 치팅을 배운다 • RL 성능은 알고리즘만이 아니라 환경 설계에 달려 있다
이 구간의 핵심 정리는 인사이트컷(InsightCut)이 작성했습니다. 원본 영상의 저작권은 Sequoia Capital에게 있으며, 영상은 공식 YouTube 플레이어로 재생됩니다. 자막 전문은 게재하지 않습니다.