원본 영상: How Cursor Trained Composer on Fireworks: Distributed Infrastructure for High-Performance RL · 채널 Sequoia Capital · 구간 10:20–12:11
RL은 모델 학습이 아니라 거대한 폐루프다 • rollout은 예측이 아니라 환경 속 전체 세션 실행이다 • 보상 신호가 늦을수록 업데이트 지연이 누적된다 • 학습 성능은 알고리즘보다 시스템 조율에 좌우된다
이 구간의 핵심 정리는 인사이트컷(InsightCut)이 작성했습니다. 원본 영상의 저작권은 Sequoia Capital에게 있으며, 영상은 공식 YouTube 플레이어로 재생됩니다. 자막 전문은 게재하지 않습니다.