[20260710 특별세미나] Training language models to follow instructions with …
페이지 정보

본문
[일시] 2026.07.10.
[세미나 주제]
Training language models to follow instructions with human feedback
[발표자]
김희지
[요약]
본 발표에서는 인간 피드백을 활용하여 언어 모델을 사용자 의도에 맞게 조정하는 연구인 InstructGPT와, Reward Model의 해석 가능성과 평가 안정성을 개선한 ArmoRM을 소개하였다. 기존의 대규모 언어 모델은 다음 단어 예측 기반의 사전학습을 통해 높은 언어 생성 능력을 보였으나, 사용자의 지시를 정확히 따르거나 사람이 선호하는 방식으로 답변을 생성하는 데에는 한계가 있었다. 특히 단순한 언어 모델링 목적함수만으로는 답변의 유용성, 정확성, 안전성, 정직성 등을 직접 반영하기 어렵기 때문에, 인간 선호를 학습 과정에 포함하는 alignment 방법론의 필요성이 제기되었다.
이를 해결하기 위해 InstructGPT는 RLHF(Reinforcement Learning from Human Feedback) 기반의 3단계 학습 구조를 제안하였다. 먼저 사람이 작성한 demonstration response를 이용하여 GPT-3를 supervised fine-tuning함으로써 초기 instruction-following model을 학습한다. 이후 동일한 prompt에 대해 여러 모델 응답을 생성하고, 사람이 이 응답들을 선호도 순서로 ranking한 데이터를 이용해 Reward Model을 학습한다. Reward Model은 사람이 선호한 응답에 더 높은 reward를 부여하도록 학습되며, 마지막으로 PPO를 통해 언어 모델이 Reward Model로부터 높은 점수를 받는 응답을 생성하도록 최적화된다. 이때 모델이 Reward Model만 과도하게 최적화하여 기존 SFT 모델에서 지나치게 벗어나는 것을 막기 위해 KL penalty를 사용하며, PPO-ptx에서는 pretraining objective를 함께 사용해 기존 언어 능력의 손상을 줄이고자 한다. 이러한 구조를 통해 InstructGPT는 단순히 문장을 잘 생성하는 모델이 아니라, 사람의 지시와 선호에 더 잘 맞는 응답을 생성하는 모델로 개선되었다.
그러나 InstructGPT의 Reward Model은 최종적으로 하나의 scalar reward만 출력하기 때문에, 어떤 기준 때문에 특정 응답이 더 좋은지 해석하기 어렵다는 한계가 있다. 예를 들어 어떤 답변이 높은 reward를 받았을 때, 그 이유가 helpfulness 때문인지, correctness 때문인지, safety 때문인지 구분하기 어렵다. 또한 여러 평가 기준이 하나의 점수로 압축되기 때문에, prompt의 성격에 따라 중요하게 보아야 할 기준이 달라지는 상황을 충분히 반영하기 어렵다. ArmoRM은 이러한 한계를 해결하기 위해 Absolute-Rating Multi-Objective Reward Model과 Mixture-of-Experts gating을 결합한 2단계 학습 구조를 제안하였다. 첫 번째 단계에서는 prompt-response pair에 대해 helpfulness, correctness, honesty, safety, verbosity 등 여러 objective별 absolute rating을 예측하도록 Reward Model을 학습한다.
즉, 기존 Reward Model이 하나의 reward score만 출력했다면, ArmoRM은 응답을 여러 평가 기준으로 나누어 점수화한다. 이를 통해 응답 품질을 더 세분화하여 해석할 수 있으며, 각 objective가 최종 평가에 어떤 영향을 주는지 분석할 수 있다. 두 번째 단계에서는 pairwise preference data를 이용하여 MoE gating layer를 학습한다. 여기서 MoE는 여러 개의 독립적인 모델 expert를 사용하는 구조라기보다, 여러 reward objective를 expert처럼 보고 각 objective를 얼마나 반영할지 결정하는 weight selector에 가깝다. Regression layer가 objective별 reward score를 예측하면, gating layer는 prompt의 특성에 따라 safety, correctness, helpfulness 등의 중요도 weight를 계산한다. 이후 objective score와 weight의 weighted sum을 통해 최종 scalar reward를 생성한다. 예를 들어 수학 문제에서는 correctness와 reasoning의 weight가 높아지고, 안전성과 관련된 질문에서는 safety의 weight가 높아지는 방식으로, prompt context에 맞는 평가 기준 조합을 학습한다.
결론적으로, InstructGPT는 인간 피드백을 활용해 언어 모델을 instruction-following model로 정렬하는 RLHF의 기본 구조를 제시한 연구이며, ArmoRM은 그중 Reward Model 부분을 더 세분화하고 해석 가능하게 확장한 연구라고 볼 수 있다. InstructGPT가 demonstration, preference ranking, PPO를 통해 사람이 선호하는 응답을 생성하는 전체 학습 pipeline을 제안했다면, ArmoRM은 하나의 scalar reward로는 설명하기 어려운 응답 평가 과정을 multi-objective reward와 MoE gating으로 분해하여 더 유연하고 해석 가능한 Reward Model을 제안하였다. 두 연구는 모두 인간의 피드백을 모델 학습에 반영한다는 공통점을 가지지만, InstructGPT는 최종 언어 모델의 alignment에 초점을 두고, ArmoRM은 Reward Model의 평가 구조와 해석 가능성 개선에 초점을 둔다는 점에서 차이가 있다.
Q. ArmoRM은 여러 reward objective를 학습하고 이를 조합하는 구조인데, 학습 데이터의 도메인 분포에 따라 크게 영향을 받을 수 있을 것 같습니다. 실제로 학습 데이터에는 다양한 도메인이 포함되어 있었나요?A. 네, ArmoRM은 데이터 도메인의 영향을 받을 수 있습니다. 그래서 논문에서는 하나의 데이터셋만 사용하지 않고, 일반 대화, instruction following, safety, code, math, reasoning 등을 포함하는 여러 reward/preference dataset을 결합해 학습했습니다. 이를 통해 특정 도메인에 과도하게 치우치는 것을 줄이려 했지만, 학습 데이터에 없는 특수 도메인에서는 여전히 일반화 한계가 있을 수 있습니다.
[관련 논문]
- Training language models to follow instructions with human feedback
- Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
[녹화 영상]
https://us06web.zoom.us/rec/share/-XqoUwbRYpAF0B_9VIgNvvF7PAl_CkAy5tpRCProxyvo37kQ3ndhYuA67kXpkhs.4u4F8Dm-Iq27PScT
[세미나 주제]
Training language models to follow instructions with human feedback
[발표자]
김희지
[요약]
본 발표에서는 인간 피드백을 활용하여 언어 모델을 사용자 의도에 맞게 조정하는 연구인 InstructGPT와, Reward Model의 해석 가능성과 평가 안정성을 개선한 ArmoRM을 소개하였다. 기존의 대규모 언어 모델은 다음 단어 예측 기반의 사전학습을 통해 높은 언어 생성 능력을 보였으나, 사용자의 지시를 정확히 따르거나 사람이 선호하는 방식으로 답변을 생성하는 데에는 한계가 있었다. 특히 단순한 언어 모델링 목적함수만으로는 답변의 유용성, 정확성, 안전성, 정직성 등을 직접 반영하기 어렵기 때문에, 인간 선호를 학습 과정에 포함하는 alignment 방법론의 필요성이 제기되었다.
이를 해결하기 위해 InstructGPT는 RLHF(Reinforcement Learning from Human Feedback) 기반의 3단계 학습 구조를 제안하였다. 먼저 사람이 작성한 demonstration response를 이용하여 GPT-3를 supervised fine-tuning함으로써 초기 instruction-following model을 학습한다. 이후 동일한 prompt에 대해 여러 모델 응답을 생성하고, 사람이 이 응답들을 선호도 순서로 ranking한 데이터를 이용해 Reward Model을 학습한다. Reward Model은 사람이 선호한 응답에 더 높은 reward를 부여하도록 학습되며, 마지막으로 PPO를 통해 언어 모델이 Reward Model로부터 높은 점수를 받는 응답을 생성하도록 최적화된다. 이때 모델이 Reward Model만 과도하게 최적화하여 기존 SFT 모델에서 지나치게 벗어나는 것을 막기 위해 KL penalty를 사용하며, PPO-ptx에서는 pretraining objective를 함께 사용해 기존 언어 능력의 손상을 줄이고자 한다. 이러한 구조를 통해 InstructGPT는 단순히 문장을 잘 생성하는 모델이 아니라, 사람의 지시와 선호에 더 잘 맞는 응답을 생성하는 모델로 개선되었다.
그러나 InstructGPT의 Reward Model은 최종적으로 하나의 scalar reward만 출력하기 때문에, 어떤 기준 때문에 특정 응답이 더 좋은지 해석하기 어렵다는 한계가 있다. 예를 들어 어떤 답변이 높은 reward를 받았을 때, 그 이유가 helpfulness 때문인지, correctness 때문인지, safety 때문인지 구분하기 어렵다. 또한 여러 평가 기준이 하나의 점수로 압축되기 때문에, prompt의 성격에 따라 중요하게 보아야 할 기준이 달라지는 상황을 충분히 반영하기 어렵다. ArmoRM은 이러한 한계를 해결하기 위해 Absolute-Rating Multi-Objective Reward Model과 Mixture-of-Experts gating을 결합한 2단계 학습 구조를 제안하였다. 첫 번째 단계에서는 prompt-response pair에 대해 helpfulness, correctness, honesty, safety, verbosity 등 여러 objective별 absolute rating을 예측하도록 Reward Model을 학습한다.
즉, 기존 Reward Model이 하나의 reward score만 출력했다면, ArmoRM은 응답을 여러 평가 기준으로 나누어 점수화한다. 이를 통해 응답 품질을 더 세분화하여 해석할 수 있으며, 각 objective가 최종 평가에 어떤 영향을 주는지 분석할 수 있다. 두 번째 단계에서는 pairwise preference data를 이용하여 MoE gating layer를 학습한다. 여기서 MoE는 여러 개의 독립적인 모델 expert를 사용하는 구조라기보다, 여러 reward objective를 expert처럼 보고 각 objective를 얼마나 반영할지 결정하는 weight selector에 가깝다. Regression layer가 objective별 reward score를 예측하면, gating layer는 prompt의 특성에 따라 safety, correctness, helpfulness 등의 중요도 weight를 계산한다. 이후 objective score와 weight의 weighted sum을 통해 최종 scalar reward를 생성한다. 예를 들어 수학 문제에서는 correctness와 reasoning의 weight가 높아지고, 안전성과 관련된 질문에서는 safety의 weight가 높아지는 방식으로, prompt context에 맞는 평가 기준 조합을 학습한다.
결론적으로, InstructGPT는 인간 피드백을 활용해 언어 모델을 instruction-following model로 정렬하는 RLHF의 기본 구조를 제시한 연구이며, ArmoRM은 그중 Reward Model 부분을 더 세분화하고 해석 가능하게 확장한 연구라고 볼 수 있다. InstructGPT가 demonstration, preference ranking, PPO를 통해 사람이 선호하는 응답을 생성하는 전체 학습 pipeline을 제안했다면, ArmoRM은 하나의 scalar reward로는 설명하기 어려운 응답 평가 과정을 multi-objective reward와 MoE gating으로 분해하여 더 유연하고 해석 가능한 Reward Model을 제안하였다. 두 연구는 모두 인간의 피드백을 모델 학습에 반영한다는 공통점을 가지지만, InstructGPT는 최종 언어 모델의 alignment에 초점을 두고, ArmoRM은 Reward Model의 평가 구조와 해석 가능성 개선에 초점을 둔다는 점에서 차이가 있다.
Q. ArmoRM은 여러 reward objective를 학습하고 이를 조합하는 구조인데, 학습 데이터의 도메인 분포에 따라 크게 영향을 받을 수 있을 것 같습니다. 실제로 학습 데이터에는 다양한 도메인이 포함되어 있었나요?A. 네, ArmoRM은 데이터 도메인의 영향을 받을 수 있습니다. 그래서 논문에서는 하나의 데이터셋만 사용하지 않고, 일반 대화, instruction following, safety, code, math, reasoning 등을 포함하는 여러 reward/preference dataset을 결합해 학습했습니다. 이를 통해 특정 도메인에 과도하게 치우치는 것을 줄이려 했지만, 학습 데이터에 없는 특수 도메인에서는 여전히 일반화 한계가 있을 수 있습니다.
[관련 논문]
- Training language models to follow instructions with human feedback
- Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
[녹화 영상]
https://us06web.zoom.us/rec/share/-XqoUwbRYpAF0B_9VIgNvvF7PAl_CkAy5tpRCProxyvo37kQ3ndhYuA67kXpkhs.4u4F8Dm-Iq27PScT
첨부파일
-
20260710_김희지_Training language models to follow instructions with human feedback.pdf (953.7K)
DATE : 2026-07-24 11:27:39
댓글목록
등록된 댓글이 없습니다.