연구소/벤더
Liquid AI DSpark, LFM2.5 추론 속도 최대 3.2배 개선
작은 초안 모델이 먼저 답을 예측하고 큰 모델이 한 번에 검증하는 방식으로 AI 응답 속도를 GPU에서 최대 3.18배, 온디바이스에서 최대 2.87배까지 끌어올렸어요
HuggingFace
The Brief가 FactStack이 되었습니다
태그
‘speculative decoding’ 태그가 달린 글 1건
작은 초안 모델이 먼저 답을 예측하고 큰 모델이 한 번에 검증하는 방식으로 AI 응답 속도를 GPU에서 최대 3.18배, 온디바이스에서 최대 2.87배까지 끌어올렸어요