The Brief FactStack이 되었습니다

FactStack
GeekNews

AMD의 Taalas 인수, 모델 전용 칩으로 추론 비용 절감과 처리 속도 10배 향상

테크 프레스

한마디로

AI 모델의 무게를 칩에 직접 새겨서 빠르고 저렴하게 답변을 만드는 기술을 AMD가 사들였어요

무슨 내용인가

AMD가 모델 가중치를 실리콘에 직접 새기는 Taalas를 인수해 Nvidia 중심의 추론 가속 시장에 진입합니다. Taalas의 HC1 칩은 Llama 3.1 8B를 초당 16,960토큰으로 처리해 Nvidia GPU보다 48배, Cerebras보다 8.5배 빠르며, 2026년 출시 예정인 HC2는 칩당 200억 파라미터를 지원해 50개 칩으로 1조 파라미터 모델을 운영할 수 있어요. AMD는 프롬프트 처리는 Instinct GPU가, 토큰 생성은 Taalas 칩이 담당하는 분리형 아키텍처를 구성하려고 하는데, 토큰 비용을 낮추고 출력 속도를 10–20배 높이면 테스트 시간 스케일링 같은 긴 추론 방식의 활용이 크게 확대될 수 있습니다

에디터 노트 · FactStack

가중치를 실리콘에 새긴다는 건 유연성을 포기하고 속도와 단가를 사는 거래예요. 모델이 바뀌면 칩을 다시 굽는다는 뜻이라, 매주 버전이 갈아엎히는 지금의 LLM 생태계에서 하드코딩된 추론기가 얼마나 오래 쓸모를 유지할지가 관건이죠. 실무자라면 48배·10–20배 같은 벤치마크 숫자보다, 2026년 HC2가 나온 뒤 어떤 모델이 실제로 지원되고 재프로그래밍 주기가 어떤지를 확인한 다음에 추론 인프라 계획에 반영해도 늦지 않아요.

실무 시사점

프리미엄 추론 서비스를 운영하는 마케팅 플랫폼이나 AI 에이전트 기반 고객 상담 시스템을 갖춘 기업이라면, 토큰당 비용 절감과 응답 속도 향상으로 서비스 품질과 수익성을 동시에 높일 수 있어요

태그

용어 풀이
AMD Taalas
AMD가 인수한 AI 칩 스타트업으로, 모델의 가중치를 실리콘에 직접 새겨 빠르고 저렴한 추론을 가능하게 하는 기술 개발
model-specific integrated circuit
특정 AI 모델에 최적화된 칩으로, 모델의 가중치가 하드웨어에 고정되어 있어 해당 모델 추론에만 사용되는 전용 집적회로
test-time scaling
AI 모델이 답변을 내놓기 전에 더 오래 생각하게 해서 시간과 정확성을 교환하는 방식으로, 더 많은 추론 토큰을 소비하는 대신 더 나은 답을 얻는 기법
inference cost
AI 모델이 사용자의 요청에 답하기 위해 실행되는 과정에서 발생하는 비용으로, 주로 토큰당 가격으로 측정됨
공유

관련 글