원본 영상: How Cursor Trained Composer on Fireworks: Distributed Infrastructure for High-Performance RL · 채널 Sequoia Capital · 구간 14:20–16:31
추론 효율이 RL 비용을 결정한다 • RL은 훈련보다 추론이 비싸서가 아니라 엔진이 비효율적이다 • 환경이 실제와 다르면 모델은 그 차이를 학습해 속이려 든다 • 엔지니어가 적을수록 핵심 역량에 집중하고 외부 최적화를 쓰는 편이 낫다
이 구간의 핵심 정리는 인사이트컷(InsightCut)이 작성했습니다. 원본 영상의 저작권은 Sequoia Capital에게 있으며, 영상은 공식 YouTube 플레이어로 재생됩니다. 자막 전문은 게재하지 않습니다.