← Back to feed
Papers·2개월 전

HRBench: 하이브리드 추론 LLM의 사고 모드 전환 전략을 12가지 설정으로 통합 평가

HRBench: 하이브리드 추론 LLM의 사고 모드 전환 전략을 12가지 설정으로 통합 평가

Tencent와 HKUST 팀이 하이브리드 추론 LLM의 사고 모드 전환 전략을 체계적으로 비교하는 평가 프레임워크 HRBench를 공개했습니다. 3가지 전략군(프롬프트 기반, 외부 라우팅, 투기적 실행)과 4가지 훈련 방식(훈련 없음, SFT, 오프라인 RL, 온라인 RL)을 조합한 12가지 설정을 Qwen3.5-2B부터 Kimi-K2.5-1.1T까지 6개 모델, 5개 벤치마크에서 평가했습니다. 흥미로운 점은 프롬프트 기반 방식이 토큰-정확도 트레이드오프에서 유리하고, 라우팅 방식은 비용 감소가 안정적이며, 투기적 방식은 토큰 비용이 높지만 정확도를 높이는 경향을 보인다는 점입니다. 단, 벤치마크가 수학·과학·코드에 한정되어 있어 일반 대화 도메인으로의 일반화는 추가 검증이 필요합니다.

하이브리드 추론 LLM의 사고 모드 전환 전략을 12가지 설정으로 통일된 파이프라인에서 비교한 평가 프레임워크 HRBench가 공개되었습니다.

핵심 결론

  • 범위6개 LLM, 5개 벤치마크(수학·과학·코드), 12가지 설정 평가.
  • 주요 발견프롬프트 기반 선택이 토큰-정확도 균형에서 가장 유리했고, 외부 라우팅은 비용 감소가 안정적, 투기적 실행은 정확도 향상에 유리하나 토큰 비용이 높았습니다.
  • 영향훈련 방식과 모델 규모, 태스크 도메인에 따라 최적 전략이 달라져, 단일 전략의 우월성을 주장하기 어렵다는 점을 보여줍니다.

방법

  • 설계 공간전략군 3가지(프롬프트 기반, 외부 라우팅, 투기적 실행) × 훈련 방식 4가지(훈련 없음, SFT, 오프라인 RL, 온라인 RL) = 12가지 설정.
  • 재구현기존 12개 이상의 대표 방법을 동일 파이프라인 안에서 재구현하여 공정 비교를 보장했습니다.
  • 모델Qwen3.5-2B, Kimi-K2.5-1.1T 등 다양한 규모의 하이브리드 추론 LLM을 포함.

한계·조건

  • 도메인수학·과학·코드 벤치마크에 한정되어 일반 대화나 창작 태스크로의 일반화는 추가 검증이 필요합니다.
  • 코드GitHub에 데이터, 코드, 저장소 공개 완료 — 재현 가능.

편집자 한 줄

하이브리드 추론 LLM의 전략 선택에 대한 실용적인 가이드 역할을 할 만한 벤치마크입니다. 다만 벤치마크가 특정 도메인에 편중된 점은 감안해야 합니다.

  • #hybrid-reasoning
  • #evaluation
  • #tencent
  • #hkust
  • #llm
Tencent
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —