Skip to content

Post-training

  • Published on
    2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한 전제를 먼저 밝히면, 대부분의 오픈 웨이트 릴리스는 학습 데이터 구성을 공개하지 않습니다. 어느 곳이 실제로 공개했고 어느 주장이 만든 쪽의 자체 측정인지 문단마다 구분해 적었습니다.