← Back to feed
Papers·2개월 전

서울대, 연구 수준 수학 문제 14K 공개 — Qwen3 fine-tuning 평균 9.2점 향상

서울대, 연구 수준 수학 문제 14K 공개 — Qwen3 fine-tuning 평균 9.2점 향상

서울대 연구팀이 학술 소스에서 14,056개의 연구 수준 수학 문제를 수집한 ResearchMath-14k 데이터셋을 공개했습니다. 220K 개의 teacher trajectory 를 생성한 후 agentic filtering 으로 정제해 Qwen3 (4B~30B) 를 fine-tuning 한 결과, base 모델 대비 평균 9.2점 개선을 확인했습니다. 흥미로운 점은 최신 모델일수록 허위 참조를 5.0배 더 많이 생성하는 회피 행동이 관찰된 점입니다.

서울대 연구팀이 학술 소스에서 14,056개의 연구 수준 수학 문제를 수집한 ResearchMath-14k 데이터셋을 공개했습니다.

핵심 결론

  • 데이터셋ResearchMath-14k: 14,056개 문제로, 연구 수준 수학 문제 중 가장 큰 공개 컬렉션입니다.
  • 성능Qwen3 (4B~30B) fine-tuning 시 base 대비 평균 9.2점 향상 — fully correct reasoning 없이도 유용한 supervision 이 가능함을 보여줍니다.

방법

  • 데이터 수집arXiv, 학술 논문 등에서 multi-agent pipeline 으로 문제를 추출·검증했습니다.
  • Teacher trajectory두 개의 open model 로 220K 개의 trajectory 를 생성, agentic filtering 으로 회피 행동(비시도, 허위 참조)을 걸러냈습니다.
  • 회피 행동 분석8개 open-weight 모델 비교 결과, 최신 모델일수록 참조 수는 5.6배, 허위 참조 수는 5.0배 증가했습니다.

한계·조건

  • 범위연구 수준 문제에 특화되어 있어, 초·중등 수학이나 일반 reasoning 벤치마크와의 비교는 아직 없습니다.
  • 공개ResearchMath-14k 는 공개되었으며, trajectory 데이터와 fine-tuned 모델도 추후 공개 예정입니다.

편집자 한 줄

허위 참조가 최신 모델에서 더 많이 발생한다는 분석은 alignment 연구에 시사점이 있을 만합니다.

  • #math
  • #dataset
  • #reasoning
  • #seoul-national-university
Seoul National University
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —