zerovoids.dev
zerovoids.dev

Ø NEWS

머신러닝 · 라이브러리

Transformers 5.14 — 멀티토큰 디코딩과 프리필 가속

Hugging Face Transformers 5.14가 멀티토큰 예측 디코딩을 넣고, 큰 입력의 프리필을 최대 260% 빠르게 했다. 새 오픈 모델 Inkling·TIPSv2 지원도 함께 들어왔다.

키워드ai-mlperformancetooling

Transformers 5.14는 새 기능을 늘리기보다, 이미 있는 모델을 더 빨리·싸게 돌리는 쪽에 무게를 뒀다. LLM 서비스 비용의 상당 부분은 토큰을 하나씩 뽑는 디코딩에서 나오는데, 이번 판은 그 지점을 두 가지로 손봤다. 멀티토큰 예측(MTP) 디코딩은 다음 토큰을 하나가 아니라 여러 개를 한 번에 내다봐 디코딩 단계를 줄이고, speculative decoding에는 static ensemble verification이 붙어 초안 토큰의 채택률을 높였다.

프리필도 빨라졌다. SDPA 프리필이 FlashAttention 커널과 StaticCache를 쓰도록 바뀌면서, 입력이 큰 경우 최대 260%까지 빨라진다. 세 변화 모두 모델을 키우는 게 아니라 같은 하드웨어에서 추론을 더 싸게 만드는 방향이고, 그게 모델별 코드가 아니라 공용 라이브러리 층에 들어왔다는 점이 크다. 오픈 모델 상당수가 이 라이브러리를 거쳐 배포되고 실행되기 때문이다.

새 모델 지원도 같은 맥락에 있다. 5.14는 Inkling과 TIPSv2 계열을 얹었는데, Inkling은 전체 975B에 질의당 41B만 켜지는 MoE로 텍스트·이미지·오디오를 함께 받는다. 프론티어급 오픈 모델은 이렇게 공용 라이브러리에 실려야 실제로 쓰이기 시작한다. 반대로 GPTNeoX와 GPTBigCode는 가중치 이름 규칙이 바뀌어, 이전 이름에 기대던 코드는 업그레이드 전에 손봐야 한다. 5.14.0은 7월 15일 릴리스, 현재 패치는 5.14.1이다.

References