원본 영상: How Cursor Trained Composer on Fireworks: Distributed Infrastructure for High-Performance RL · 채널 Sequoia Capital · 구간 37:37–40:07
보상은 자동화될수록 강해진다 • verifiable reward가 있을수록 compute를 더 태울 수 있다 • 인간이 직접 채점하기 어려운 문제는 judge나 시뮬레이터가 필요하다 • 좋은 전문가의 역할은 점수 매기기가 아니라 기준을 설계하는 일이다 • 제품 경험을 평가식으로 바꾸는 순간 학습 시스템이 된다
이 구간의 핵심 정리는 인사이트컷(InsightCut)이 작성했습니다. 원본 영상의 저작권은 Sequoia Capital에게 있으며, 영상은 공식 YouTube 플레이어로 재생됩니다. 자막 전문은 게재하지 않습니다.