Paper Review09.292026-09-29 09:0019 min read[논문 리뷰] Learning to Stop — reasoning token은 stop rule보다 confidence signal로 줄일 수 있을까ConfSFT 논문을 통해 reasoning model의 토큰 비용을 explicit stop policy가 아니라 confidence supervision 관점에서 해석한다.#reasoning#inference-efficiency#confidence+1