Papers·2개월 전
서울대, 연구 수준 수학 문제 14K 공개 — Qwen3 fine-tuning 평균 9.2점 향상

서울대 연구팀이 학술 소스에서 14,056개의 연구 수준 수학 문제를 수집한 ResearchMath-14k 데이터셋을 공개했습니다. 220K 개의 teacher trajectory 를 생성한 후 agentic filtering 으로 정제해 Qwen3 (4B~30B) 를 fine-tuning 한 결과, base 모델 대비 평균 9.2점 개선을 확인했습니다. 흥미로운 점은 최신 모델일수록 허위 참조를 5.0배 더 많이 생성하는 회피 행동이 관찰된 점입니다.
서울대 연구팀이 학술 소스에서 14,056개의 연구 수준 수학 문제를 수집한 ResearchMath-14k 데이터셋을 공개했습니다.
핵심 결론
- 데이터셋 — ResearchMath-14k: 14,056개 문제로, 연구 수준 수학 문제 중 가장 큰 공개 컬렉션입니다.
- 성능 — Qwen3 (4B~30B) fine-tuning 시 base 대비 평균 9.2점 향상 — fully correct reasoning 없이도 유용한 supervision 이 가능함을 보여줍니다.
방법
- 데이터 수집 — arXiv, 학술 논문 등에서 multi-agent pipeline 으로 문제를 추출·검증했습니다.
- Teacher trajectory — 두 개의 open model 로 220K 개의 trajectory 를 생성, agentic filtering 으로 회피 행동(비시도, 허위 참조)을 걸러냈습니다.
- 회피 행동 분석 — 8개 open-weight 모델 비교 결과, 최신 모델일수록 참조 수는 5.6배, 허위 참조 수는 5.0배 증가했습니다.
한계·조건
- 범위 — 연구 수준 문제에 특화되어 있어, 초·중등 수학이나 일반 reasoning 벤치마크와의 비교는 아직 없습니다.
- 공개 — ResearchMath-14k 는 공개되었으며, trajectory 데이터와 fine-tuned 모델도 추후 공개 예정입니다.
편집자 한 줄
허위 참조가 최신 모델에서 더 많이 발생한다는 분석은 alignment 연구에 시사점이 있을 만합니다.
- #math
- #dataset
- #reasoning
- #seoul-national-university
Seoul National University