제2장 문헌 연구 - 자가진화 에이전트의 세 기둥에 대한 심층 분석2.1 Self-Evolving LLM의 개념과 계보Self-Evolving LLM은 학습 완료 후 가중치가 고정되는 기존 패러다임을 벗어나, 모델 스스로 데이터를 생성하고 평가하며 학습을 폐쇄 루프(Closed-loop)로 수행하는 체계를 의미한다.이 계보는 2022년 STaR에서 시작된다. STaR: Bootstrapping Reasoning With Reasoning은 Stanford와 Google Research가 제안한 방법으로, 정답이 있는 QA 데이터에 대해 모델이 스스로 추론 과정(rationale)을 샘플링하고, 정답에 도달한 rationale만으로 다시 학습시켜 점진적으로 어려운 문제를 풀도록 한다. STaR의 핵심은 외..