INDEX5
Week of 2026-W39

KV 캐시가 SSD 로 내려가면 낸드 회사는 언제 돈을 버나

2026년 9월 28일약 62분Stocks Espresso Research
2026-W39|반도체 섹터|2026-09-28
KV 캐시가 SSD 로 내려가면 낸드 회사는 언제 돈을 버나
이번 호 딥다이브

한눈에 보기

솔리다임은 SK하이닉스가 주인인 자회사로, 낸드(전원이 꺼져도 데이터가 남는 저장용 반도체)로 만든 저장장치를 팝니다. 이 회사가 최대 1,500억 달러 가치로 미국 상장을 검토한다는 보도가 나왔습니다. 상장은 회사를 잘게 나눈 조각인 주식을 증권시장에 올려 누구나 사고팔게 하는 일입니다. AI 가 저장장치를 많이 쓸수록 덕을 볼 곳으로 꼽히는 회사입니다.

같은 달 중국 통신장비 회사 화웨이는 KV 캐시(AI 가 대화를 이어 가려고 기억해 두는 중간 계산 결과)만 담는 저장장치를 발표했습니다. 솔리다임이 파는 SSD(낸드 칩 여러 개를 담아 만든 저장장치)도 이런 저장장치에 들어갑니다.

KV 캐시는 원래 GPU(AI 계산을 맡는 칩) 바로 옆의 빠르지만 작은 메모리(계산하는 동안 잠깐 쓰는 칠판 같은 곳)에 둡니다. 대화가 길어지면 이 메모리가 모자랍니다. 그때 넘친 캐시는 버렸다가 처음부터 다시 계산하거나, SSD 에 맡겼다가 꺼내 쓸 수 있습니다. SSD 는 메모리보다 느리지만 훨씬 많이 담습니다.

AI 칩을 만드는 엔비디아는 캐시만 맡아 두는 SSD 저장장치의 설계를 CMX 라는 이름으로 내놓았고, 실제 제품은 협력사들이 만들어 팝니다. 캐시를 여기 두었다가 필요할 때 GPU 쪽으로 미리 옮겨 씁니다. 입력이 길면 다시 계산할 때보다 첫 글자가 수십 배 빨리 나왔습니다. 입력이 짧으면 다시 계산이 금방 끝나, 다시 계산하는 편이 더 빨랐습니다.

기업용 SSD 매출(물건을 팔아 번 돈)은 2026년 2분기(4~6월)에 2024년 1분기의 약 10배가 됐지만, 대부분은 가격이 오른 덕분입니다. 값은 다시 떨어질 수 있어, 많이 팔아서 늘었는지를 따로 봐야 합니다. 지금 매출에서 KV 캐시 몫만 떼어 낸 숫자는 공개되지 않았습니다.

CMX 를 넣은 협력사 제품은 2026년 하반기에 나옵니다. 제품이 팔리고 회사들이 실적을 발표해야 숫자로 보입니다. 그래서 이 저장장치가 낸드 회사 매출을 따로 늘리는지는 빨라야 2026년 4분기~2027년에 확인됩니다.

솔리다임 상장설과 새로 나온 KV 캐시 전용 저장장치

솔리다임은 데이터센터용 SSD 를 파는 회사입니다3. 데이터센터는 큰 컴퓨터(서버)를 한데 모아 쉬지 않고 돌리는 건물입니다. SK하이닉스의 낸드 자회사인 솔리다임이 이르면 2027년 미국 상장을 검토한다는 보도가 나왔습니다. 뉴스 통신사 로이터 보도를 옮긴 기사는 기업가치(회사 전체에 매긴 값)를 최대 1,500억 달러, 상장으로 모을 돈을 약 150억 달러로 전했습니다1. 경제 매체 블룸버그는 기업가치가 최대 1,000억 달러에 이를 수 있다고 보도했습니다2.

솔리다임을 포함한 SK하이닉스의 낸드 자회사 묶음은 2026년 상반기에 매출 12조 2,507억 원을 올렸습니다4. 같은 기간 순이익(쓴 돈을 빼고 남은 돈)은 5조 8,396억 원입니다4. 번 돈의 절반 가까이가 남을 만큼 장사가 잘된다는 뜻입니다(계산값). SK하이닉스가 법에 따라 공개한 반기 보고서(공시)에 나온 숫자입니다. 공시상 이름은 「SK hynix NAND Product Solutions 와 자회사」입니다4.

회사는 아직 정해진 것이 없다는 입장입니다. SK하이닉스는 9월 4일 공시에서 솔리다임이 여러 방안을 검토하고 있지만 확정된 사항은 없다고 밝혔습니다6. 8월 한국경제신문이 솔리다임의 상장 전 투자 유치 추진을 보도하자 이를 해명한 공시였습니다6.

이번 보도 뒤에는 관련 회사 주가(주식 한 주의 값)가 내렸습니다. 블룸버그는 이 소식 뒤 SK하이닉스 주가가 5%, SK스퀘어가 8% 넘게 떨어졌다고 전했습니다2. 미국 경제 매체 24/7 Wall St 에 따르면 9월 28일 장중에 마이크론과 웨스턴디지털이 4%, 샌디스크가 5% 내렸습니다5. 셋 다 미국 메모리·저장장치 회사입니다.

보도에서는 상장 검토 배경으로 이런 주식을 사려는 투자자가 많다는 점을 들었습니다. 로이터는 그 배경을 「AI 인프라 관련 기업을 찾는 투자자 수요」로 적었습니다7. 블룸버그는 이 소식을 솔리다임이 SK스퀘어의 손자회사(자회사가 가진 자회사)라는 소유 구조 쪽에서 다뤘습니다2.

보도들은 KV 캐시를 상장 까닭으로 들지 않았습니다. KV 캐시 이야기는 회사와 일부 논평에서 나옵니다. SK하이닉스는 7월 실적 발표에서 GPU 가까이 두는 AI 저장장치 개발에 힘을 쏟겠다고 말했습니다(전자 업계 매체 디일렉이 옮긴 발표 전문)8. 쓰임새로는 KV 캐시를 GPU 밖으로 옮겨 두는 일을 꼽았습니다8.

KV 캐시는 AI 가 대화를 이어 가려고 기억해 두는 중간 계산 결과입니다. 이 캐시는 보통 GPU 바로 옆의 작은 메모리에 둡니다. 9월 17일 화웨이는 이 캐시만 담는 저장장치 「OceanStor M900」을 발표했습니다9. AI 추론(학습을 마친 모델이 질문에 답을 내는 일)에 쓰는 캐시를 SSD 까지 넓혀 담는 제품입니다9.

가격 사이클을 걱정하는 논평도 있습니다. 가격 사이클은 메모리가 모자라면 값이 오르고, 공장이 늘어 남아돌면 값이 떨어지는 일이 몇 년마다 되풀이되는 것을 말합니다. 투자 정보 회사 모닝스타의 애널리스트(회사를 분석해 평가하는 사람)는 7월 SK하이닉스 자신이 미국 증시에 상장할 때 의견을 냈습니다. 메모리 가격이 급등한 이유는 심한 공급 부족으로 봤습니다10. 2027~2028년에 새 공급이 나오면 사이클이 꺾일 것이라고 덧붙였습니다10.

투자 정보 매체 트레이딩키도 솔리다임이 KV 캐시 수요로 덕을 볼 것이라면서, 새 공급이 나오면 가격이 떨어질 수 있다고 적었습니다11. 지금 높은 몸값이 가격이 잠깐 오른 덕이라면, 값이 떨어질 때 회사 몸값도 함께 줄어듭니다.

솔리다임 상장설은 주식 시장이 「AI 스토리지」, 곧 AI 에 쓰이는 저장장치 회사에 큰 값을 매기기 시작했다는 신호입니다. 그러나 그 값이 KV 캐시를 담는 저장장치 덕분이라고 볼 근거는 없습니다. 이렇게 본 근거는 로이터·블룸버그의 2026년 9월 보도와 SK하이닉스 공시입니다. 로이터는 상장 검토 배경으로 AI 인프라 관련 기업을 찾는 투자자 수요를 들었습니다. 몸값이 KV 캐시에 거는 기대 덕인지, 메모리 가격이 잠깐 오른 덕인지 나눠 본 논평은 없습니다.

상장설이 KV 캐시와 얼마나 닿아 있는지 가리려면, 이 캐시가 무엇이고 왜 SSD 까지 내려오는지부터 알아야 합니다. 그래야 이 저장장치가 낸드 회사의 매출을 언제, 얼마나 바꿀지도 따져 볼 수 있습니다.

KV 캐시의 크기와 GPU 메모리(HBM)의 한계

AI 언어 모델(글을 읽고 쓰는 AI 프로그램)은 글을 토큰(글자 몇 개 크기의 조각) 단위로 읽고 씁니다. AI 는 답을 한꺼번에 쓰지 않고 토큰을 하나씩 이어 붙여 씁니다. 그래서 새 토큰을 만들 때마다 앞에 나온 토큰을 모두 참고해야 합니다. 그래서 이미 처리한 토큰마다 계산해 둔 값을 보관해 두고, 새 토큰 몫만 새로 계산합니다12. 이렇게 보관해 둔 값이 KV 캐시입니다.

💡 KV 캐시란?

KV 캐시는 두 가지 값(Key·Value)을 모아 둔 메모리입니다. AI 모델은 이미 읽은 토큰마다 두 값을 계산해 둡니다. 이 값이 있으면 다음 글자를 만들 때 앞부분을 다시 계산하지 않아도 됩니다. 긴 책을 읽으며 적어 둔 요약 메모와 같습니다. 메모를 버리면 책을 처음부터 다시 읽어야 합니다.

문제는 크기입니다. 대화가 길어질수록 KV 캐시도 커집니다. 공개 AI 모델 LLaMA3-70B 로 재 보면 토큰 하나에 KV 캐시가 320KB 필요합니다. 128K(12만 8천) 토큰짜리 긴 대화 하나면 40GB 가 됩니다13.

이 캐시는 GPU 바로 옆에 붙은 빠른 메모리에 두는데, 이 메모리를 고대역폭 메모리(HBM)라고 부릅니다. 대역폭은 1초에 옮길 수 있는 데이터 양입니다. 빠르지만 담을 수 있는 양은 많지 않습니다. 엔비디아 H200 GPU 한 장의 HBM 은 141GB 이고14, 최신 세대인 루빈 GPU 도 한 장에 최대 288GB 입니다15.

GPU 한 장은 여러 사람의 대화를 한꺼번에 처리합니다. 그런데 128K 토큰 대화 세 개면 캐시만 120GB 입니다. H200 한 장의 HBM 을 거의 다 채우는 양입니다(계산값 — 글쓴이가 직접 계산한 값). 모델이 배운 내용을 담은 숫자(가중치)가 차지하는 자리는 뺀 계산인데도 그렇습니다. 그래서 넘친 캐시를 더 크고 느린 곳으로 내려 두는 방법을 찾게 됩니다.

표 1. 모델별 토큰 하나당 KV 캐시 크기 — LLaMA3-70B 의 40GB 는 원문 값(이진 단위), 나머지 128K 값은 10진 GB 계산값
모델토큰 하나당128K 토큰 대화 하나
DeepSeek-V370.272KB약 9.2GB
LLaMA3-70B320KB40GB
LLaMA-3.1 405B516.096KB약 67.6GB

표 1 의 값은 숫자 하나를 16비트(0 과 1 을 적는 칸 16개)로 적는 방식(BF16) 기준입니다1213. 모델마다 7배 넘게 차이가 나지만(계산값), 어느 모델이든 대화가 길수록 캐시도 커집니다.

엔비디아는 문맥(모델이 참고하는 앞 대화 전체)이 길어지면 캐시 용량이 길이만큼 늘어난다고 설명했습니다16. 대화가 두 배 길어지면 캐시도 두 배가 된다는 뜻입니다. 반면 앞 대화를 처음부터 다시 계산하는 연산량은 그보다 훨씬 빠르게 늘어난다고 덧붙였습니다16. 그래서 대화가 길수록 캐시를 버리고 다시 계산하는 손해가 캐시를 보관하는 부담보다 훨씬 커집니다.

에이전트(AI 모델에게 여러 단계의 일을 차례로 시켜 끝까지 처리하는 프로그램)를 쓰면 이 캐시가 더 커집니다. 에이전트는 작업 하나를 마칠 때까지 AI 모델과 수십 번 주고받고, 그때마다 앞 대화를 거의 그대로 다시 넣기 때문입니다. 실제 코딩 에이전트 기록으로 만든 공개 시험(누구나 같은 조건으로 성능을 재는 문제 모음)을 보면, 작업 하나에서 보통 43번을 주고받았습니다17. 한 번에 넣는 입력도 보통 14.2만 토큰으로 앞에서 본 128K 대화보다 길었고, 그 가운데 96% 넘게가 앞 요청과 같은 내용이었습니다17.

다른 기록에서도 30번째 요청(AI 에게 한 번 보내는 질문) 무렵 문맥이 약 8만 토큰이었습니다. 요청마다 새로 붙는 토큰은 수백~수천 개뿐이었습니다18. 같은 내용을 매번 다시 계산하지 않으려면 캐시를 남겨 둬야 합니다. 이 캐시는 추론 엔진, 곧 모델을 돌려 답을 내주는 소프트웨어가 관리합니다. 공개 추론 엔진 vLLM 은 이런 작업을 여럿 함께 돌리려면 요청과 요청 사이에 캐시를 GPU 밖으로 내려 둬야 한다고 적었습니다17.

넘친 캐시를 버리고 다시 계산하기와 내려 두었다 불러오기

GPU 메모리가 차면 추론 엔진은 캐시 일부를 내보내야 합니다. vLLM 원논문에 따르면 메모리가 바닥날 때 가장 늦게 온 요청의 캐시를 통째로 내보냅니다19.

내보낸 캐시를 되살리는 방법은 둘입니다. CPU(컴퓨터 전체의 일을 맡는 중앙 칩) 쪽 메모리에 옮겨 두었다가 다시 가져오거나, 버렸다가 처음부터 다시 계산하는 것입니다. 논문은 어느 쪽이 나은지가 CPU·GPU 사이 전송 속도와 GPU 계산 속도에 달렸다고 봤습니다19. 옮겨 오는 시간이 다시 계산하는 시간보다 짧으면 옮기는 쪽이, 길면 다시 계산하는 쪽이 낫다는 뜻입니다.

지금 vLLM 은 기본 설정에서 캐시를 버리고 다시 계산합니다20. 여러 층에 내려 두었다가 불러오는 기능은 따로 켜야 합니다21. 층은 GPU 에 가까울수록 위인데, 위층은 빠르지만 좁고 아래층은 느리지만 넓습니다.

이 기능을 켜면 캐시는 먼저 CPU 옆 D램(CPU 가 쓰는 일반 메모리)으로 내려가고, 거기서 파일 저장장치 같은 아래 층으로 옮겨 갑니다21. 불러올 때는 D램부터 찾고, 없으면 아래 층에서 찾아 D램을 거쳐 GPU 로 올립니다21. vLLM 문서에 따르면 이 방식에서는 아래 층이 GPU 와 직접 데이터를 주고받지 못합니다22. 그래서 아래 층의 캐시는 D램을 한 번 더 거쳐 오느라 시간이 더 걸립니다.

불러오기는 답의 첫 글자를 더 빨리 내려고 쓰는 방법입니다. 화웨이 클라우드·싱가포르국립대 연구진이 2K 토큰으로 재 보니, 다시 계산하는 데 약 360ms, 불러오는 데 약 192ms 가 걸렸습니다23. 1ms 는 1,000분의 1초입니다. 다만 디스크(SSD 같은 저장장치)는 읽는 속도가 초당 5GB 에 못 미쳐, 곧 쓸 캐시는 미리 메모리에 올려 둬야 한다고 봤습니다23.

엔비디아는 KV 캐시를 「다시 계산할 수 있는」 데이터로 봅니다16. 잃어버려도 다시 계산하면 되기 때문입니다. 그래서 이 캐시를 담을 저장장치를 고를 때는 오래 보존하는 것보다 전력·비용·속도를 먼저 따진다고 설명했습니다16.

💡 첫 토큰 지연이란?

첫 토큰 지연은 질문을 보낸 뒤 AI 가 답의 첫 글자를 내놓기까지 걸리는 시간입니다. 영어 약자로 TTFT 라고 씁니다. 긴 입력을 처음부터 계산하면 이 시간이 길어지고, 저장해 둔 캐시를 불러와 계산을 건너뛰면 짧아질 수 있습니다.

엔비디아 CMX 와 KV 캐시를 담는 다섯 층

CMX 는 엔비디아가 KV 캐시만 담으려고 만든 SSD 저장 층입니다. 엔비디아는 KV 캐시를 「컨텍스트 메모리」라고 부릅니다. 엔비디아는 이 층을 2026년 1월 CES 전시회에서 「추론 컨텍스트 메모리 스토리지 플랫폼」이라는 이름으로 처음 발표했습니다24. 블루필드-4(데이터 전송을 맡는 전용 칩)로 돌아가는 저장장치입니다24. 이름이 여럿이지만 모두 KV 캐시를 담는 같은 저장 층을 가리킵니다.

3월 자사 개발자 행사(GTC)에서는 다른 회사가 제품을 만들 때 따르는 스토리지 참조 설계(STX)를 내놓았습니다25. STX 의 첫 랙(서버 여러 대를 세워 담는 선반) 단위 구성에 「CMX 컨텍스트 메모리 스토리지 플랫폼」이 들어갔습니다25. CMX 는 엔비디아 최신 세대인 베라 루빈(베라 CPU 와 루빈 GPU 를 묶은 것) 플랫폼에 속합니다26.

엔비디아는 KV 캐시가 오가는 자리를 G1 부터 G4 까지 네 층으로 나눕니다16. G1 은 GPU 의 HBM 으로, 지금 답을 만드는 데 쓰는 캐시가 들어갑니다. HBM 에서 밀려난 캐시는 CPU 쪽 D램인 G2 가 잠시 맡습니다.

그 아래 G3 는 서버 안에 붙은 로컬 SSD 입니다. 엔비디아는 G3 가 서버 한 대에 묶여 있어 관리하고 늘리기 어렵다고 설명했습니다16. G4 는 여러 서버가 함께 쓰는 공유 저장장치(스토리지)로, 당장 쓰지 않는 데이터를 둡니다. 여기에 CMX 가 한 층을 더 끼워 다섯 층이 됩니다.

CMX 는 G3 와 G4 사이에 「G3.5」라는 층을 새로 넣습니다16. 이더넷(서버끼리 잇는 네트워크)으로 연결한 플래시(낸드로 만든 저장장치)로, KV 캐시만 담도록 만들었습니다. 저장 매체는 서버용 고속 SSD 이고, 블루필드-4 가 SSD 를 관리하면서 캐시의 오류 검사와 암호화를 맡습니다27. G3 는 서버 한 대만 쓰고 G4 는 모두가 쓰지만 느린데, G3.5 는 여러 서버가 같이 쓰면서 캐시만 빠르게 담는 칸입니다.

용량은 「GPU 묶음마다 페타바이트급 공유 용량」이라고 엔비디아가 밝혔습니다16. 페타바이트는 테라바이트(TB)의 천 배입니다. 엔비디아는 기술 매체 Blocks & Files 질의에 GPU 한 장당 최대 16TB 라고 답했지만, 공식 자료에 적힌 수치는 아닙니다28. 앞 세대 서버에 GPU 한 장당 들어 있던 로컬 SSD 3.84TB 의 네 배쯤입니다(계산값). GPU 한 장마다 붙는 SSD 가 늘어나는 만큼 낸드 회사가 팔 물량도 늘어납니다.

KV 캐시가 오가는 다섯 층의 분해도. 아래부터 공유 스토리지, CMX 플래시, 로컬 SSD, CPU D램, GPU HBM 이 같은 두께로 띄워 쌓여 있고, 넘친 캐시는 GPU HBM 에서 CMX 플래시로 내려 두었다가 답을 쓰기 전에 CMX 플래시에서 GPU HBM 으로 미리 올린다.
그림 1. KV 캐시가 오가는 다섯 층. 아래부터 G4 공유 스토리지, G3.5 CMX 플래시, G3 로컬 SSD, G2 CPU D램, G1 GPU HBM 입니다. 아래로 갈수록 느리고, 층의 두께는 크기와 무관합니다. 넘친 캐시는 HBM 에서 D램·로컬 SSD 를 거쳐 CMX 까지 내려가고, 답을 쓰기 직전에 CMX 에서 D램이나 HBM 으로 미리 올라옵니다. 엔비디아 기술 블로그를 바탕으로 그렸습니다.

캐시는 이 층을 오르내립니다. 문맥이 HBM 에 다 들어가지 않으면 캐시는 D램(G2)과 SSD(G3)로 내려갑니다. 한 층 내려갈 때마다 캐시를 꺼내 오는 데 드는 시간·전력·비용은 늘어납니다16. 대신 아래 층일수록 훨씬 넓어서, 위층에서 넘친 캐시를 버리지 않고 담아 둘 수 있습니다.

추론 소프트웨어는 답을 쓰기 전에 필요한 캐시를 CMX 에서 G2 나 G1 으로 미리 올려 둡니다16. 엔비디아는 이렇게 미리 올리면 GPU 가 기다리는 시간이 줄어, 긴 문맥 작업에서 초당 처리하는 토큰이 최대 5배 늘어난다고 밝혔습니다16. 다만 비교 대상은 「기존 스토리지 방식」이었고, 모델이나 문맥 길이 같은 조건은 공개하지 않았습니다24.

넘친 캐시를 D램으로 빨리 내려 보내려면 GPU 와 CPU 사이 통로가 넓어야 합니다. 루빈 GPU 와 베라 CPU 는 초당 1.8TB 로 연결됩니다15. 엔비디아는 이 연결을 KV 캐시를 내려 보내는 통로로 꼽았습니다15. 루빈 서버에 달린 블루필드-4 는 캐시를 요청하고, 네트워크 너머의 CMX 저장용 서버와 캐시를 주고받습니다26. 저장용 서버 쪽에서는 블루필드-4 가 하나 더 들어가 SSD 묶음을 관리합니다26.

표 2. KV 캐시가 머무는 층과 그 층을 다루는 부품 — 크기·속도는 루빈 세대 엔비디아 발표 기준, G3 는 앞 세대(블랙웰) DGX(엔비디아 완제품 서버) 예시
층무엇어디에크기·속도다루는 부품
G1GPU HBMGPU 바로 옆GPU 한 장 최대 288GB · 초당 22TB · 나노초 단위 접근1516루빈 GPU
G2CPU D램CPU 옆CPU 한 개 최대 1.5TB · 초당 1.2TB15베라 CPU — GPU 와 초당 1.8TB 로 이어져 캐시를 받음15
G3로컬 SSD서버 안블랙웰 세대 DGX 는 GPU 한 장당 약 3.84TB29—
G3.5CMX 플래시이더넷 너머 저장 노드GPU 묶음마다 페타바이트급 · 지연 수치는 공개 안 함16서버 쪽 블루필드-4(DPU, 데이터 처리 전용 칩)가 이더넷 스위치 너머로 요청하고, 저장 노드의 블루필드-4 가 SSD 묶음을 관리·암호화2627
G4공유 스토리지데이터센터 공용밀리초 단위 지연, 추론 효율이 가장 낮음16—

SSD 층은 HBM 이나 D램을 대신하지 않고 그 아래에 붙습니다. 초당 전송량이 루빈 GPU 한 장의 HBM4 는 22TB, 베라 CPU 의 D램은 1.2TB, 최신 SSD 한 개는 약 14GB 입니다1530. 1TB 가 1,000GB 이므로 셋은 자릿수부터 다릅니다. 엔비디아도 층을 G1~G4 로 나누고 CMX 를 G3.5 에 두며, 답을 쓰기 직전에는 캐시를 위층으로 미리 올립니다. vLLM 에서도 아래 층의 캐시는 GPU 로 바로 가지 못하고 반드시 D램을 거칩니다.

SSD 는 넘친 캐시를 보관해 두었다가 필요할 때 미리 올려 주는 곳이고, GPU 가 계산하면서 바로 읽는 메모리는 아닙니다. 캐시를 불러와도 첫 토큰이 빨리 나올 뿐, 그 뒤로 토큰을 만들어 내는 속도는 그대로입니다31. 불러오기는 앞 대화를 다시 읽는 계산만 건너뛰게 해 줄 뿐, 답을 한 글자씩 써 나가는 일은 GPU 가 그대로 해야 하기 때문입니다. 다만 다시 계산하던 시간을 아낀 만큼 GPU 가 다른 요청을 더 처리할 수 있어, 한 시간에 만드는 토큰 수 전체는 늘어납니다.

긴 문맥에서 불러오기로 줄어든 첫 토큰 지연

엔비디아는 캐시를 GPU 밖으로 내려 효과를 보는 조건을 두 가지로 들었습니다32. 캐시가 GPU 메모리에 다 들어가지 않을 것, 그리고 캐시를 재사용해 얻는 이득이 옮기는 부담보다 클 것입니다32. 입력이 길수록 이 조건에 잘 맞습니다. 긴 입력은 다시 계산하는 데 오래 걸려, 옮겨 오는 수고를 하고도 남기 때문입니다.

2024년 엔비디아 시험에서는 앞 세대 H100 에서 캐시를 CPU 메모리에서 불러오자 긴 입력의 첫 토큰이 최대 14배 빨리 나왔습니다33. 미국 컴퓨터 회사 IBM 의 연구 조직은 128K 토큰 입력을 다시 계산하면 19초 걸리던 것을 자사 스토리지에서 불러와 1.6초로 줄였습니다34.

중국 AI 회사 딥시크는 2024년 8월부터 API(다른 프로그램이 AI 를 불러 쓰는 창구) 대화 캐시를 디스크 여러 대에 두고 있습니다35. 앞 대화와 겹치는 부분이 많은 128K 입력은 첫 토큰 지연이 13초에서 0.5초로 줄었습니다35. AI 회사는 처리한 토큰 수만큼 요금을 받는데, 캐시에서 찾은 토큰은 새로 계산하는 토큰 요금의 10분의 1만 받았습니다35. 다시 계산하지 않으니 회사도 돈이 덜 들기 때문입니다.

화웨이 클라우드 연구진이 세 층을 재 보니, 캐시 적중률(필요한 캐시가 저장돼 있던 비율)은 HBM 만 쓰면 거의 0% 였습니다23. HBM 은 좁아서 지난 캐시를 거의 남기지 못합니다. D램을 더하면 1.7~19.1%, SSD 까지 더하면 71~90% 로 올라갔습니다23. 적중률이 높을수록 다시 계산할 일이 줄어듭니다.

루빈 바로 앞 세대인 블랙웰 GPU 로 한 시험도 결과가 같습니다. IBM·엔비디아·슈퍼마이크로는 블랙웰 세대 RTX PRO 6000 GPU 한 장으로 다시 계산하는 시간을 쟀습니다36. 입력이 1만 토큰이면 0.572초, 13만 토큰이면 32.14초가 걸렸습니다36. 공유 스토리지에서 불러오면 길이와 상관없이 0.193~0.57초였고, 13만 토큰에서는 56배 빨랐습니다36.

블랙웰 세대 RTX PRO 6000 한 장, 13만 토큰 입력에서 잰 첫 토큰 지연. 다시 계산하면 32.14초, 공유 스토리지에서 불러오면 0.57초 이하.
그림 2. 같은 GPU(블랙웰 세대 RTX PRO 6000 한 장)·같은 13만 토큰 입력에서 잰 첫 토큰 지연. 다시 계산하면 32.14초, 공유 스토리지에서 불러오면 0.57초 이하로 56배 빨랐습니다. 불러오기 시간은 입력 길이와 상관없이 0.193~0.57초였습니다. 출처: IBM 레드북.

인터넷으로 AI 용 컴퓨터를 빌려주는 회사 네비우스와 스토리지 회사 WEKA 는 9월 24일 함께 시험 결과를 냈습니다. 블랙웰 세대 B300 GPU 8장을 단 서버에서 실제 서비스 요청 기록을 8시간 동안 재생했습니다37. HBM 만 쓴 구성과 플래시 층을 더한 구성을 비교했고, 플래시 층은 서버 8대의 로컬 SSD 를 묶어 만들었습니다37.

플래시 층을 더하자 요청의 절반이 1.05초 안에 첫 토큰을 받았습니다. HBM 만 쓸 때는 이 시간이 5.68초였습니다37. 캐시 적중률은 40%에서 93%로, GPU 한 대가 한 시간에 내놓은 토큰은 4.6만 개에서 16.9만 개로 늘었습니다37. 다만 그때는 이 모델에 맞는 D램 층 기능이 없어서 D램 층과는 비교하지 못했습니다38. 그래서 이 효과가 SSD 덕인지, D램만 더해도 났을지는 이 시험으로 알 수 없습니다.

서버 회사 델은 GB300 GPU 4장에 중국 AI 회사 문샷 AI 와 딥시크의 모델을 하나씩 올려 8K~128K 토큰 입력을 시험했습니다. 다시 계산하는 쪽은 처리 속도(1초에 처리하는 토큰 수)가 초당 약 8천~1만 4천 토큰에서 더 오르지 않았습니다39. 스토리지에서 불러오는 쪽은 128K 문맥에서 초당 7.89만 토큰까지 처리했습니다39.

캐시를 모두 찾을 수 있는 조건에서는 32K~128K 구간에서 두 모델 모두 불러오기가 더 빨랐습니다39. 딥시크 모델 DeepSeek-V4-Pro 에서는 문맥이 길수록 첫 토큰 지연을 줄이는 효과도 커졌습니다39.

표 3. 최신 GPU 에서 잰 불러오기 효과 — 세 시험 모두 회사가 직접 잰 값(2026년 발표)
시험GPU조건비교 기준불러오기
IBM·엔비디아·슈퍼마이크로RTX PRO 6000 1장요청 1개, 1만~13만 토큰재계산 0.572초 → 32.14초0.193~0.57초 (13만 토큰에서 56배)36
네비우스·WEKAB300 8장실제 트래픽 8시간 재생HBM 만 쓸 때 5.68초(요청 절반 기준) · 적중률 40%1.05초 · 적중률 93%37
델GB300 4장32K~128K, 캐시를 모두 찾는 조건재계산 초당 약 8천~1만 4천 토큰에서 멈춤128K 에서 초당 7.89만 토큰39

세 시험 모두 GPU 서버나 저장장치를 파는 회사가 직접 잰 값이라, 다른 곳에서도 똑같이 나올지는 알 수 없습니다. 한편 WEKA 는 B300 시험에서 캐시 층 성능을 다 쓰지 않았다고 밝혔습니다38. 그러니 이 수치가 저장 층이 낼 수 있는 최대치는 아니고, 더 좋아질 여지도 있습니다.

몇 분 안의 재사용은 D램, 몇 시간 뒤의 재사용은 SSD

캐시는 대부분 짧은 간격으로 다시 쓰입니다. 중국 인터넷 회사 알리바바의 실서비스 기록을 분석한 논문이 있습니다. 사람과 대화하는 서비스에서는 캐시를 다시 쓴 경우의 80% 가 10분 안이었습니다40. 기업 프로그램이 API 로 부르는 서비스에서는 80% 가 10초 안이었습니다40.

같은 논문 계산으로는 캐시 적중률을 최대로 끌어올리는 데 HBM 의 4배쯤 되는 용량이 필요했습니다. 흔한 서버(GPU 8장에 CPU 메모리 1TB)라면 GPU 한 장이 쓸 수 있는 CPU 메모리가 캐시용 HBM 의 4배에 가깝습니다40. 그래서 SSD 없이 CPU D램으로 감당할 수 있다고 결론 내렸습니다40.

하지만 오래 묵었다가 다시 쓰이는 캐시도 있습니다. Mooncake 는 문샷 AI 가 만든 캐시 공유 시스템입니다. Mooncake 팀이 공개 기록을 분석해 보니, 30분이 지나서 다시 쓰이는 캐시는 코딩 작업에서 10.3%, 추론 작업에서 5.0% 였습니다41. 30분 넘게 묵는 캐시는 많아야 열에 하나 정도라는 뜻입니다.

Mooncake 팀은 D램 512GB 아래에 SSD 2TB 를 붙인 2층 캐시를 가정해 계산도 했습니다42. 코딩 에이전트 기록에 적용하니 캐시 적중률은 88.5% 였습니다. 그 가운데 약 95.1% 는 D램에서, 약 4.9% 만 SSD 에서 찾았습니다42.

같은 팀의 다른 시험에서는 7번째 요청에서 D램이 가득 차자, SSD 가 없는 구성의 적중률이 83% 에서 36% 로 떨어졌습니다41. SSD 를 켜면 8번째 요청까지 84% 이상을 유지했습니다41. 평소에는 SSD 몫이 작지만, D램이 꽉 차는 순간에는 SSD 가 있어야 적중률이 무너지지 않는다는 뜻입니다.

AI 회사는 메모리 자리가 한정돼 있어, 캐시를 정해진 시간(보존 시간)만 남겨 두고 지웁니다. 그래서 다음 요청이 그 안에 오느냐가 중요합니다. 반도체 분석 회사 SemiAnalysis 가 공개한 코딩 에이전트 기록을 보면 요청의 절반은 앞 요청 뒤 10초 안에 왔습니다43. 그러나 스무 번에 한 번은 약 7분 넘게, 백 번에 한 번은 약 50분 넘게 쉬었다가 왔습니다43. 보존 시간이 5분이면 이런 요청은 캐시를 잃습니다.

워싱턴대 연구진은 캐시를 놓치는 경우 대부분이 사람이 결과를 읽고 생각하는 사이 보존 시간이 지나 버릴 때라고 봤습니다(심사 전 논문)44. 심사 전 논문은 다른 전문가의 검토를 아직 거치지 않은 논문입니다.

홍콩과기대·알리바바·바이트댄스 연구진이 분석한 실서비스는 캐시 보존 시간이 5분이었습니다. 여기서는 세션(한 사용자가 이어서 주고받은 대화 묶음)의 59.4% 가 캐시를 한 번 이상 잃었습니다(심사 전 논문)45. 연구진은 그 때문에 든 비용을 전체의 31.5% 로 추정했습니다45.

표 4. 코딩 에이전트가 다음 요청까지 쉰 시간 — 2026년 4월 공개 기록(739세션·5.9만 요청). 스무 번에 한 번 이상은 앤트로픽 기본 보존 시간(5분)을 넘김
이만큼의 요청이이 시간 안에 옴
절반(50%)10초
75%30초
90%154초
95%약 7분
99%약 50분43

문샷 AI 는 문맥을 100만 토큰까지 쓰는 코딩 작업을 살폈습니다. 입력은 보통 앞 대화 40만 토큰에 새 입력 4천 토큰이 붙는 모양이었습니다(심사 전 논문)46. 앞부분을 캐시에서 찾으면 못 찾을 때보다 비용이 자릿수가 다를 만큼, 곧 열 배 넘게 싸다고 했습니다46.

챗GPT 를 만든 오픈AI는 캐시를 오래 남기려고 저장장치를 쓴다고 밝혔습니다. 공식 문서 두 곳에 따르면, 24시간 보존 옵션을 켠 캐시는 메모리가 찼을 때 「GPU 로컬 스토리지」로 내려갑니다4748. GPU 서버 안의 저장장치에 옮겨 보관 용량을 늘리는 방식입니다. 24시간은 가장 길게 남는 시간이고, 이 옵션을 켜도 캐시는 보통 약 30분 남습니다48. 데이터 무보존 설정(대화를 남기지 말라는 설정)을 켜지 않은 조직은 2026년 5월 29일부터 이 24시간 보존이 기본값이 됐습니다49.

표 5. AI 회사가 밝힌 캐시 보존 시간과 저장 위치 — 2026년 9월 각 사 문서 기준
회사보존 시간밝힌 저장 위치
오픈AI메모리 보존: 쓰지 않으면 5~10분(최대 1시간) · 24시간 옵션: 보통 약 30분(최대 24시간), 무보존 설정이 없는 조직은 2026-05-29 부터 기본값4849메모리가 차면 GPU 로컬 스토리지47
앤트로픽기본 5분 · 추가 요금을 내면 1시간50문서에 적지 않음50
구글 Gemini명시적 캐시 기본 1시간(원하는 값으로 설정) · 시간당 보관료5152—
딥시크API: 쓰지 않으면 보통 몇 시간~며칠 안에 지움 · V4.1 논문: 전역 캐시 최소 72시간5354디스크(2024년 공지) · SSD 기반 영속 캐시(V4.1)3554

딥시크는 V4.1 논문에서 캐시를 두 가지로 나눠, 오래 쓸 캐시는 SSD 에 사흘 넘게, 금방 쓸 캐시는 D램에 몇 분만 둡니다(심사 전 논문)54. 대화 전체를 참고하는 전역 캐시는 SSD 에 두는 영속 캐시(오래 남겨 두는 캐시)로 최소 72시간 보관합니다54.

최근 대화만 참고하는 슬라이딩 윈도 캐시는 서버마다 D램의 10% 를 떼어 만든 공용 풀(여럿이 함께 쓰려고 모아 둔 메모리)에 몇 분만 둡니다54. 드물게 캐시를 놓치면 빠진 부분만 다시 계산해 채웁니다. 전작처럼 전부 다시 계산하는 방식은 비용을 감당하기 어려웠다고 적었습니다54.

SSD 는 몇 분에서 몇 시간 뒤에야 다시 쓰이는 드문 캐시를 받습니다. 몇 분 안에 다시 쓰이는 캐시는 D램에서 해결되고, 2층 캐시 계산에서도 SSD 에서 찾은 몫은 약 5% 였습니다. 그러나 이런 캐시를 한 번 놓치면 수십만 토큰의 앞부분을 다시 계산해야 해 비용이 큽니다. 오픈AI 가 24시간 보존에 GPU 로컬 스토리지를 쓰듯, 분 단위 보관은 메모리가, 시간 단위 보관은 저장장치가 나눠 맡습니다.

이런 수요(쓰려는 곳)는 주로 에이전트와 긴 대화에서 생기는데, 코딩 에이전트는 입력이 14만 토큰대이고 그 가운데 95% 넘게가 앞 요청과 겹칩니다. 반면 채팅과 코딩이 섞인 추론 서비스 Chutes 의 1년 기록을 보면 입력은 대개 수천 토큰이었습니다(심사 전 논문)55. 이 서비스에서는 긴 입력일수록 재사용 비율도 낮았습니다. 입력이 짧으면 다시 계산하는 편이 빨라, 보통 채팅에서는 SSD 층이 쓰일 일이 적습니다. 엔비디아도 이 층이 필요한 이유로 에이전트의 장기 기억을 들었습니다.

엔비디아 파트너·화웨이·스토리지 회사의 KV 캐시 제품

엔비디아는 CMX 가 들어간 참조 설계 STX(다른 회사가 따라 만드는 설계도)를 스토리지 회사 12곳과 함께 만들고 있습니다25. AI 연구소와 클라우드 회사(인터넷으로 컴퓨터를 빌려주는 회사) 8곳은 STX 를 컨텍스트 메모리(KV 캐시) 저장장치로 도입하겠다고 밝혔습니다25. STX 기반 협력사 제품을 2026년 하반기에 내놓는다는 일정은 5월 말 GTC 타이베이에서도 바뀌지 않았습니다56.

SSD 를 사서 묶어 파는 스토리지 회사들은 CMX 를 기다리지 않고 KV 캐시 제품을 먼저 내놓았습니다. WEKA 는 2025년 11월 판매를 시작하면서 128K 토큰 입력의 첫 토큰 지연을 재계산보다 20배 줄였다고 주장했습니다57. VAST 데이터도 엔비디아 추론 소프트웨어 Dynamo 와 함께 쓴 시험에서 최대 20배를 내세웠습니다58. DDN은 자사 연결 모듈이 엔비디아의 KV 캐시 전송 프로그램에 기본으로 들어갔다며, 스토리지 회사로는 처음이라고 밝혔습니다59. 이 수치는 모두 회사가 직접 낸 값이고 시험 조건도 서로 다릅니다.

클라우드 회사는 설계 지침을 내놓았습니다. 아마존의 클라우드 회사 AWS는 KV 캐시를 GPU HBM 부터 인터넷 저장소 S3 까지 4단으로 나눠 두는 참조 구조를 제시했습니다60. 다만 자사 서비스가 이 구조를 그대로 쓴다고 적지는 않아, 실제로 이렇게 사서 쓰는지는 알 수 없습니다60. 구글 클라우드는 내부 실험 결과, 외부 KV 캐시 저장소를 쓰면 총소유비용(장비·전기·관리비 합계)을 최대 35% 줄일 수 있다고 밝혔습니다61. 같은 일을 GPU 를 약 40% 덜 쓰고 해낼 수 있다는 계산도 덧붙였습니다61.

화웨이는 엔비디아와 별도로 같은 시장에 뛰어들었습니다. 화웨이 설명으로는 M900 이 자사 AI 칩(NPU) 묶음의 KV 캐시를 SSD 까지 넓혀 담습니다. 클러스터(서버 여러 대를 묶은 한 덩어리) 하나에 64PB 가 들어갑니다9. CPU·네트워크·낸드 제어 칩을 한데 묶어 AI 칩과 SSD 사이 접근 지연을 60마이크로초(1마이크로초는 100만분의 1초)로 낮췄다고 했습니다9. 다만 처리량 2배, 첫 토큰 지연 절반이라는 주장에는 「일반적인 AI 프로그래밍 상황」이라는 조건을 달았습니다9.

문샷 AI 는 새 장비를 사지 않고 캐시를 늘립니다. 서빙 시스템 Mooncake 는 GPU 서버에 이미 있지만 쉬고 있는 CPU·D램·SSD 를 묶어 캐시 풀을 만듭니다62. 문샷 AI 는 이 방식으로 요청을 75% 더 처리했고62, 이 풀 덕분에 「추가 비용 없이」 캐시를 늘릴 수 있다고 밝혔습니다63. 2026년 7월에는 Mooncake 공개판에 서버마다 있는 SSD 를 클러스터 전체의 캐시 풀로 묶는 기능이 들어갔습니다41. 이미 있는 SSD 를 묶어 쓰는 방식이라, 낸드 회사의 새 매출로는 잡히지 않을 수 있습니다.

표 6. KV 캐시 저장 제품과 회사가 밝힌 효과 — 효과 수치는 모두 회사 자체 시험
회사제품발표회사가 밝힌 효과(조건)
엔비디아CMX(블루필드-4 · 이더넷 플래시 층)2026-01 CES · 2026-03 GTC기존 스토리지 방식 대비 초당 토큰 최대 5배(조건 공개 안 함)24
화웨이OceanStor M9002026-09-17클러스터당 64PB · 접근 지연 60마이크로초9
WEKAAugmented Memory Grid2025-11-18128K 토큰 첫 토큰 지연 재계산 대비 20배 단축(OCI 검증)57
VAST 데이터Dynamo 연동 공유 스토리지2026-03-16405B 모델·128K 문맥 첫 토큰 지연 최대 20배 단축58
IBMStorage Scale2025-11-18128K 토큰 첫 토큰 지연 8~12배 단축34
델PowerScale·ObjectScale 등 CMX 지원2026-03-16—64
Lightbits LabsInferra2026-09-15 공개동시 세션 최대 16배(조건 공개 안 함)65
문샷 AIMooncake논문 공개요청 75% 더 처리(서버에서 쉬고 있는 자원 활용)62
STX 공동 설계 파트너클라우디안 · DDN · 델 · 에버퓨어 · 히타치 반타라 · HPE · IBM · 미니오 · 넷앱 · 뉴타닉스 · VAST 데이터 · WEKA25
STX 도입을 계획한 곳코어위브 · 크루소 · 아이렌 · 람다 · 미스트랄 AI · 네비우스 · 오라클 클라우드(OCI) · 벌터25

모델 쪽 KV 축소와 D램 증설, 그 뒤의 CXL·HBF

모델을 만드는 쪽에서는 캐시 크기 자체를 줄이고 있습니다. 캐시가 작아지면 SSD 로 내려올 양도 줄어듭니다. 딥시크는 2024년 V2 에서 이전 모델보다 KV 캐시를 93.3% 줄였습니다66. 2026년 V4-Pro 는 100만 토큰 기준 KV 캐시가 V3.2 의 10% 라고 딥시크는 밝혔습니다(심사 전 논문)67.

9월에 나온 V4.1-Flash 는 SSD·서버 메모리에 두는 영속 캐시를 전작의 약 1/8 로 줄였습니다54. 4비트로 저장하는 압축(같은 내용을 더 적은 자리에 적는 방법)에 배치 방식을 바꾼 효과를 더한 결과입니다. 짧게 쓰는 캐시는 SSD 가 아닌 D램 풀로 옮겼습니다54. 엔비디아도 블랙웰용 4비트 형식(NVFP4)을 쓰면 8비트보다 KV 메모리를 최대 50% 줄일 수 있다고 밝혔습니다68.

그런데 딥시크는 캐시를 줄였기에 디스크에 캐시를 둘 수 있었습니다. 캐시가 크면 디스크에서 꺼내 오는 데 오래 걸리고 자리도 많이 차지하지만, 작으면 같은 디스크에 더 많이 담고 빨리 꺼내 올 수 있기 때문입니다. 2024년 공지에서는 자사 압축 방식(MLA)으로 KV 캐시를 크게 줄였다고 적었습니다35. 그 덕분에 값싼 디스크에 캐시를 담을 수 있게 됐다고 설명했습니다35. V4.1 에서도 캐시를 줄인 뒤 전역 캐시는 여전히 SSD 에 최소 72시간 둡니다54.

D램을 늘리면 SSD 위층이 넓어집니다. 루빈 랙 하나에는 GPU 72장과 CPU 36개가 들어갑니다69. CPU 메모리는 최대 54TB 로, 같은 랙에 든 HBM4 20.7TB 의 약 2.6배입니다69. 앞 세대인 GB200 랙은 CPU 메모리가 17TB, HBM 이 13.4TB 로 D램이 1.3배쯤이었습니다(계산값)70. D램이 더 많이 받아 주는 만큼, SSD 까지 내려오는 캐시는 줄어들 수 있습니다.

CXL(CPU 에 메모리를 더 이어 붙이는, 여러 회사가 함께 정한 연결 방식) 메모리 풀도 넘친 캐시를 받을 후보입니다. 삼성전자는 6월 백서(기술을 설명하려고 낸 보고서)에서 CXL 스위치로 묶은 1TB 메모리 풀을 KV 캐시 저장소로 써 봤습니다71. GPU 8장이 함께 쓰는 설정에서 D램 성능의 약 92% 가 나왔습니다71. 삼성전자는 같은 백서에서 CXL 을 SSD 로 내리는 방식의 대안으로 내세웠지만, SSD 와 직접 비교한 수치는 내놓지 않았습니다71.

판메니아와 엑세나도 CXL 기반 KV 캐시 저장 방식을 내놓았습니다. 판메니아는 아직 제안 단계이고, 엑세나는 시제품에서 양산(공장에서 많이 만들어 파는 것) 평가로 넘어가는 단계라고 각각 밝혔습니다7273. 디일렉은 업계 소식통을 인용해 CXL 3.1 제품의 본격 양산을 2027년으로 내다봤습니다74. 삼성은 계획한 양산 일정에 맞춰 준비하고 있다고 밝혔습니다74.

HBF(낸드 칩을 층층이 쌓아 HBM 처럼 빨리 읽게 만든 새 부품)는 샌디스크와 SK하이닉스가 함께 표준을 만들고 있습니다75. SK하이닉스는 HBF 를 「HBM 과 SSD 사이의 새 메모리 층」이라고 소개했습니다76. 샌디스크가 성능 근거로 낸 수치는 KV 캐시가 아니라 모델 가중치(모델이 학습으로 얻은 값)를 읽는 시뮬레이션에서 나왔습니다77. KV 캐시가 아닌 다른 일로 잰 성능이라, KV 캐시에서도 잘할지는 알 수 없습니다.

2025년에 나온 계획으로는 첫 HBF 추론 장치 샘플이 2027년 초에 나올 예정이었습니다75. 스토리지리뷰는 올해 8월 발표에서 샘플 시점이 2027년으로 잡힌 것을 보고 일정이 계속 밀려 왔다고 평가했습니다78.

베이징대 연구진은 SSD 를 HBF 로 그대로 바꾸면 평균 지연이 2~5.5배 늘어난다는 시뮬레이션 결과를 냈습니다(심사 전 논문)79. 잠깐 쓰고 버리는 캐시를 담는 용도로는 SSD 를 대신하기 어렵다는 결론입니다79. 다만 연구진은 장치 자체의 문제는 아니며, 데이터 배치·쓰기 한도·열 관리를 함께 맞춰 설계하면 제 몫을 한다는 조건을 달았습니다79.

표 7. SSD 말고 넘친 KV 캐시를 처리하는 방법 — 2026년 9월까지 발표 기준
해법무엇을 하나SSD 층과 어떤 관계인가시점
모델 쪽 KV 축소딥시크 V4.1 영속 캐시 약 1/8, NVFP4 로 최대 50% 절감5468SSD 로 내려오는 양을 줄이지만, 디스크 캐시를 쓸 수 있게 한 조건이기도 함35진행 중
CPU D램 증설넘친 캐시를 가장 먼저 받음(루빈 랙 CPU 메모리 54TB)69몇 분 안의 재사용을 받는 위층루빈 출하 중(2026년 8월 시작)80
CXL 메모리 풀D램을 CPU 밖으로 넓힘(삼성, D램 대비 약 92%)71경쟁 기술 — SSD 와 직접 비교한 실측 없음CXL 3.1 본격 양산 2027년 예상(디일렉 보도)74
HBFHBM 과 SSD 사이 새 층76원래 목적은 가중치 읽기 · SSD 를 그대로 바꾼 시뮬레이션에서는 더 느림79추론 제품 샘플 2027년(양산 시점 아님)78

넘친 캐시는 CPU D램이 먼저 받고, 모델 쪽에서 KV 를 줄이면 SSD 로 내려오는 양도 줄어듭니다. 그런데 캐시가 작아져야 SSD 에 두는 쪽이 다시 계산보다 이득이 되기도 합니다. 딥시크는 KV 가 작아져 디스크에 캐시를 둘 수 있게 됐다고 밝혔고, 줄인 뒤에도 전역 캐시를 72시간 넘게 SSD 에 둡니다. 전에는 캐시를 버리던 곳도 캐시가 작아지면 SSD 에 두기 시작할 수 있습니다. 그래서 KV 축소는 SSD 한 개에 담기는 대화를 늘리는 동시에, SSD 에 캐시를 두는 곳 자체를 늘릴 수도 있습니다.

두 효과 가운데 어느 쪽이 더 큰지 알 수 있는 숫자는 아직 없습니다. 이 방식을 가장 오래 운영한 딥시크와 문샷 AI 도 KV 캐시용 SSD 총용량은 밝히지 않았습니다.

2026~2027년에 CXL·HBF 가 SSD 가 맡을 자리를 먼저 가져갈 근거는 약합니다. CXL 은 SSD 와 직접 비교한 실측이 없고, 판메니아는 제안 단계, 엑세나는 양산 평가로 넘어가는 단계입니다. 디일렉은 CXL 3.1 양산을 2027년으로 보도했습니다(2026년 7월, 업계 소식통 인용).

HBF 는 SSD 위에 놓이는 층이고, 성능 근거도 원래 가중치 읽기였습니다. 잠깐 쓰는 캐시를 담는 용도로는 SSD 보다 오히려 느렸습니다. 스토리지리뷰는 첫 추론 제품 샘플도 2027년으로 밀렸다고 봤습니다(2026년 8월).

대역폭·짧은 문맥·쓰기 수명, SSD 의 한계

SSD 는 HBM 보다 한 번에 옮기는 데이터가 훨씬 적습니다. 마이크론의 최신 기업용 SSD 는 한 개가 초당 최대 14,000MB(약 14GB)를 읽습니다30. 루빈 GPU 한 장의 HBM4 는 초당 최대 22TB 를 옮기니, 차이가 1,500배를 넘습니다(계산값)15. 한 번 읽는 데 걸리는 시간도 SSD 는 보통 60~100마이크로초입니다8130. 엔비디아는 HBM 을 그보다 천 배 짧은 나노초(10억분의 1초) 단위로 적었습니다16.

캐시를 불러오면 첫 토큰이 나오기까지의 시간만 줄어듭니다. VAST 데이터와 래블업의 H100 시험에서는 SSD 층에서 캐시를 불러와도 토큰 하나를 만드는 시간이 14.5ms 로 같았습니다31. SSD 층 덕분에 입력을 처음 읽는 단계는 빨라지지만, 답을 써 내려가는 속도는 달라지지 않습니다31.

입력이 짧으면 다시 계산하는 편이 빠릅니다. 암스테르담 자유대학(VU)과 IBM 연구진이 H100 서버로 재 봤습니다. 입력이 약 8K 토큰보다 짧을 때는 어느 저장장치든 불러오기가 더 느렸습니다(심사 전 논문)82. 중급 SSD 는 32K 토큰보다 짧으면 불러오기가 더 느렸습니다82. 짧은 입력은 다시 계산이 금방 끝나, 저장장치에서 찾아 옮기는 시간이 더 길기 때문입니다.

같은 연구에서 8K 입력은 앞부분의 77.8% 이상을 재사용해야 재계산과 속도가 같아졌습니다. 여기서 재사용은 저장된 캐시로 계산을 건너뛰는 것을 말합니다. 80K 입력은 7.8% 만 재사용해도 됐습니다82. 긴 입력은 조금만 겹쳐도 이득이고, 짧은 입력은 거의 다 겹쳐야 본전이라는 뜻입니다. 델의 H100 시험에서도 4K 토큰을 다시 계산하면 91ms, 불러오면 113~129ms 로 재계산이 빨랐습니다83.

네트워크가 느려도 재계산이 더 빠릅니다. B200 으로 잰 연구에서는 원격 저장소(네트워크 너머의 저장장치)에 잇는 속도를 바꿔 가며 쟀습니다. 초당 32Gb(기가비트, GB 의 8분의 1)면 입력이 256K 토큰을 넘을 때만 불러오기가 빨랐습니다(심사 전 논문)84. 연결이 초당 64Gb·128Gb 면 모든 길이에서 불러오기가 빨랐습니다84. VAST 데이터와 래블업도 일반 공유 파일 저장소(NFS)에서는 불러오기가 재계산보다 비쌀 수 있다고 적었습니다31.

GPU 가 빨라지면 저장장치도 그만큼 빨라야 합니다. GPU 가 빨라지면 다시 계산이 금방 끝나므로, 저장장치는 그보다 더 빨리 캐시를 가져와야 이득을 내기 때문입니다. Mooncake 논문 계산으로는 같은 8K 토큰 앞부분을 불러오는 데 필요한 최소 대역폭이 A800 서버에서 초당 6GB 였습니다13. 더 빠른 H800 서버에서는 초당 19GB 가 필요했습니다13. 논문은 실제로는 전송과 계산을 완벽하게 겹칠 수 없어 이보다 더 필요하다고 덧붙였습니다13.

표 8. 다시 계산하는 편이 더 빨랐던 조건 — 심사 전 논문이 많아 조건과 함께 봐야 함
조건측정결과
짧은 입력H100 · 소형 모델(심사 전 논문)약 8K 토큰 미만이면 저장장치와 상관없이 재계산보다 느림, 중급 SSD 는 32K 까지82
짧은 입력델 · H1004K 토큰: 재계산 91ms · 불러오기 113~129ms83
낮은 재사용H100 · 소형 모델(심사 전 논문)8K 입력은 앞부분 77.8% 이상을 재사용해야 본전, 80K 는 7.8%82
실서비스 재생알리바바 기록 · H100(심사 전 논문)평균 요청이 손익분기(6,203토큰)보다 짧아 SSD 를 붙여도 첫 토큰 지연이 같음82
느린 네트워크B200(심사 전 논문)초당 32Gb 연결이면 256K 토큰을 넘을 때만 불러오기가 빠름84

속도 말고도 SSD 에는 한계가 하나 더 있습니다. SSD 는 공책을 지우고 다시 쓰듯 같은 칸을 새로 쓸 때마다 조금씩 닳아서, 쓸 수 있는 양에 한계가 있습니다. 이 수명은 보통 DWPD 로 적습니다. DWPD 1 은 정해진 기간 동안 날마다 SSD 를 한 번씩 꽉 채워 새로 써도 버틴다는 뜻입니다.

마이크론의 최신 QLC SSD 사양서에는 5년 기준 참고값으로 하루 1회에서 0.075회까지가 적혀 있습니다30. 큰 데이터를 차례로 쓰면 1회, 16KB 씩 무작위로 쓰면 0.3회, 4KB 씩이면 0.075회입니다30. 작은 조각으로 흩어 쓰면 한 글자 고치려고 공책 한 쪽을 통째로 지우고 다시 쓰는 일이 생겨 수명이 빨리 줄어듭니다. 이론상 최대치이고 보증값은 아닙니다. 같은 회사 TLC 제품은 하루 1~3회입니다81.

💡 QLC란?

QLC 는 낸드의 저장 칸 하나에 4비트를 담는 방식입니다. 3비트를 담는 TLC 보다 같은 칩에 더 많이 담아 용량이 크지만 견딜 수 있는 쓰기 횟수는 적습니다. SLC 는 칸 하나에 1비트만 담는 방식으로, 가장 오래 버티는 대신 용량이 가장 작습니다.

KV 캐시는 읽기보다 쓰기가 많다는 실측이 나왔습니다. 쓰기가 많으면 SSD 가 그만큼 빨리 닳습니다. 솔리다임이 후원한 매체가 재 보니 캐시를 오가는 데이터는 쓰기가 초당 4.1GB 로, 읽기 1.1GB 보다 많았습니다85. SSD 를 파는 회사가 돈을 댄 매체라 조심해서 볼 값입니다. 베이징대 연구진도 실서비스 기록 모두에서 쓰기가 읽기보다 많았다고 밝혔습니다(심사 전 논문)79.

반대 결과를 낸 초기 연구도 있습니다. 입출력이 각 256토큰으로 짧고 모델도 작은(OPT-6.7B) 시험에서는, 한 번 쓰고 여러 번 읽어 읽기가 쓰기의 186배였습니다86. 입력이 아주 짧고 모델도 작은 옛 시험이라, 요즘 긴 대화와는 조건이 다릅니다.

SSD 에서 캐시를 불러오면 조건이 맞을 때만 재계산보다 이득입니다. 문맥이 길고, 재사용 비율이 높고, 전송이 빨라야 합니다. 엔비디아도 캐시가 GPU 메모리를 넘고 재사용 이득이 옮기는 부담보다 클 때라는 조건을 달았습니다.

문맥이 길면 이득이 큽니다. 딥시크는 디스크 캐시로 128K 입력의 첫 토큰 지연을 13초에서 0.5초로 줄였습니다. 블랙웰 GPU 에서는 13만 토큰을 다시 계산하는 데 32.14초가 걸렸지만, 불러오면 0.57초 이하였습니다. 반대로 입력이 약 8K 토큰보다 짧거나, 재사용 비율이 낮거나, 네트워크나 일반 공유 저장소가 느리면 재계산이 더 빠릅니다.

최신 GPU 에서도 긴 문맥의 이득은 그대로였습니다. B300 8장으로 실제 서비스 요청을 돌린 시험에서는 첫 토큰을 받기까지 보통 5.68초 걸리던 것이 1.05초로 줄었습니다. 다만 비교 대상은 D램 층이 아니라 HBM 만 쓴 구성이었습니다. GB300 에서는 32K~128K 전 구간에서 불러오기가 더 빨랐습니다.

그러나 GPU 가 빨라질수록 SSD 가 이득을 내기는 어려워집니다. 다시 계산이 빨라지는 만큼 저장장치도 더 빨리 가져와야 하기 때문입니다. 같은 8K 앞부분을 불러오는 데 필요한 최소 대역폭이 A800 서버 초당 6GB 에서 H800 서버 초당 19GB 로 커졌습니다13. 루빈 세대에서 불러오기와 재계산을 비교한 결과는 아직 공개되지 않아, 가장 빠른 GPU 에서도 SSD 가 이득인지는 모릅니다. 엔비디아가 말한 「최대 5배」는 재계산이 아니라 기존 스토리지 방식과 비교한 값이고, 조건도 밝히지 않았습니다26.

자주 쓰는 층의 TLC·SLC 와 용량 층의 QLC

낸드 회사들은 KV 캐시용으로 빠르고 튼튼한 TLC 를 앞세우고, 용량이 큰 QLC 는 따로 내놓습니다. 일본 낸드 회사 키옥시아는 6월 투자자 설명회에서 고대역폭 TLC 제품 「CM 시리즈」를 KV 캐시 저장에 최적화했다고 내세웠습니다87. 245TB 대용량 QLC 제품 「LC 시리즈」는 따로 소개했습니다87.

솔리다임은 CMX 에 쓸 SSD 로, GPU 가 캐시를 기다리며 멈추는 층에는 TLC 제품(D7-PS1010)을 먼저 권했습니다3. QLC 제품(D5-P5336)은 랙당 용량이 모자랄 때나, 덜 자주 쓰는 넘침 캐시에 쓰라고 제시했습니다3.

샌디스크는 8월 FMS 전시회에서 KV 캐시용 「고내구성」(쓰기를 많이 견디는) 기업용 SSD 구성을 선보인다고 밝혔습니다88. 시장 조사 회사 트렌드포스는 마이크론이 쓰기 수명이 긴 SLC SSD 를 KV 캐시용으로 개발하고 있다고 전했습니다89. 키옥시아도 KV 캐시용 고속·고내구성 SSD 를 늘리는 데 힘을 쏟고 있다고 같은 보도에서 덧붙였습니다89.

용량 제품으로는 솔리다임 D5-P5336 이 최대 122.88TB, 삼성전자 BM1743 이 최대 128.88TB 입니다9091. 마이크론은 5월 245TB 제품 출하(공장에서 내보내 파는 것)를 시작했습니다92. 솔리다임과 삼성전자는 이 제품 소개 페이지에서 KV 캐시를 언급하지 않았습니다9091. 대용량 제품은 KV 캐시용으로 내세우지 않았다는 뜻입니다.

솔리다임 제품 브리프에는 D5-P5336 의 수명이 용량별로 하루 0.42~0.6회로 적혀 있습니다93. 같은 브리프에 따르면 122.88TB 모델에 32KB 무작위 쓰기를 5년 동안 쉬지 않고 하면 수명이 약 5% 남습니다93. 5년은 버티지만 거의 다 닳는다는 뜻입니다. 앞에서 본 것처럼 작은 조각을 무작위로 쓰는 일이 잦으면 수명은 더 빨리 줄어듭니다.

QLC 를 KV 캐시에 쓰는 움직임도 있습니다. 트렌드포스는 9월 24일 글에서 KV 캐시를 담는 기본 구성이 「TLC SSD + HDD(회전 원판에 기록하는 하드디스크)」였다고 적었습니다94. 일부 운영자는 여기에 QLC SSD 를 더하기 시작했다고 덧붙였습니다94. 중국에서는 딥시크식 AI 구조가 퍼지면서, KV 캐시를 내려 둘 고용량 QLC 를 쓰는 곳이 늘고 있다고 전했습니다95. 솔리다임도 랙당 용량이 모자랄 때는 CMX 용으로 QLC 를 제시했습니다3.

표 9. 낸드 회사별 KV 캐시 관련 SSD — 2026년 9월까지 각 사 발표 기준
회사KV 캐시용으로 내세운 쪽(원문 표현)용량 층(대용량 QLC)
키옥시아고대역폭 TLC 「CM 시리즈」 — KV 캐시 저장에 최적화87245TB 「LC 시리즈」87
솔리다임TLC D7-PS1010 — GPU 가 캐시를 기다리며 멈추는 층에 먼저 권함3QLC D5-P5336, 최대 122.88TB90
샌디스크KV 캐시용 고내구성 구성(FMS 2026 전시)88BiCS10 QLC 낸드(별도 전시)88
마이크론쓰기 수명이 긴(고DWPD) SLC SSD 개발 중(트렌드포스 전언)896600 ION 245TB, 2026년 5월 출하 시작92
삼성전자실적 발표에서 KV 캐시 전용 스토리지 서버의 SSD 수요를 언급(디일렉 전문)96BM1743, 최대 128.88TB91

낸드 회사가 KV 캐시용으로 내세우는 SSD 는 대용량 QLC 가 아니라 고내구성 제품(쓰기를 많이 견디는 SSD)입니다. QLC 는 용량을 맡는 층이라 운영자들도 용량이 모자란 자리에 더하고, 작은 데이터를 무작위로 쓸 때 수명은 하루 0.075~0.3회에 그칩니다. 게다가 KV 부하(KV 캐시가 SSD 에 주는 일의 양)는 쓰기가 읽기보다 많습니다. 쓰기 증폭(요청한 양보다 SSD 안에서 더 많이 쓰게 되는 일)도 커질 수 있습니다97. 그래서 QLC 는 쓰기가 몰리는 칸에는 맞지 않습니다.

쓰기가 많다고 본 근거는 솔리다임이 후원한 매체 스토리지리뷰의 2026년 7월 실측과 베이징대 연구입니다. 화웨이와 스케일플럭스는 쓰기 배치를 관리해 수명을 늘릴 수 있다고 주장합니다.

이 층은 쓰기를 견디는 TLC 칸과 많이 담는 QLC 칸을 함께 쓰므로, 두 가지를 다 파는 회사가 한 번에 팔 수 있습니다. 그래서 이 층의 수요는 고내구성 제품과 대용량 기업용 SSD 를 둘 다 만드는 낸드 회사에 먼저 돌아갑니다. 표 9 의 다섯 회사가 모두 두 가지를 함께 내놓고 있어, 누가 더 많이 가져갈지는 아직 가를 근거가 없습니다.

기업용 SSD 매출 급등, 가격 몫과 KV 캐시 몫

기업용 SSD 시장은 크게 커졌습니다. 트렌드포스 집계로 상위 5개 회사의 합산 매출은 2024년 1분기(1~3월) 37.58억 달러였습니다98. 이 매출은 2026년 1분기 184.6억 달러99, 2분기 375.9억 달러로 늘었습니다100. 2026년 2분기 매출은 2024년 1분기의 약 10배입니다(계산값).

💡 eSSD란?

eSSD 는 서버와 데이터센터에 들어가는 기업용 SSD 입니다. 개인용 PC 에 들어가는 SSD 보다 용량이 크고, 쉬지 않고 돌아가는 환경에 맞춰 만듭니다.

트렌드포스 집계 기업용 SSD 상위 5개 회사 합산 매출. 2024년 1분기 37.58억 달러, 2026년 1분기 184.6억 달러, 2026년 2분기 375.9억 달러.
그림 3. 기업용 SSD 상위 5개 회사의 분기 합산 매출. 2026년 2분기 매출은 2024년 1분기의 약 10배지만, 늘어난 매출의 대부분은 가격이 오른 덕분입니다(표 10). 출처: 트렌드포스 보도자료(2024-05-31 · 2026-06-11 · 2026-09-01).

이 매출은 대부분 다섯 회사에 몰려 있습니다. 2분기 순위는 삼성전자 약 143.5억 달러, SK하이닉스·솔리다임 약 86.3억 달러, 마이크론 약 69.8억 달러 순이었습니다100. 키옥시아는 약 46.4억 달러, 샌디스크는 약 29.8억 달러였습니다100. KV 캐시용 SSD 를 내세운 회사도 이 다섯 곳입니다(표 9).

매출이 많이 팔아서 늘었는지, 비싸게 팔아서 늘었는지 나눠 공시한 회사도 있습니다. 값은 다시 떨어질 수 있어 이 구분이 중요합니다. 샌디스크는 연차보고서(한 해 성적을 정리한 보고서)에서 데이터센터 매출이 437% 늘었다고 밝혔습니다101. 판 양(엑사바이트)은 약 120%, GB 당 매출은 약 150% 늘었습니다101. 양이 두 배 남짓, 값이 두 배 반이 돼 매출이 다섯 배 넘게 뛴 셈입니다(계산값).

샌디스크는 4분기 매출 증가분의 약 3분의 2 도 가격 상승에서 나왔다고 설명했습니다102. 마이크론은 낸드 매출이 361% 늘었습니다. 평균판매가격(평균 값)이 310%대 중반 오르는 동안 비트 출하(판 양)는 10%대 초반 느는 데 그쳤습니다103. 판 양은 10% 남짓 늘었는데 값은 네 배 남짓이 된 셈입니다(계산값).

표 10. 낸드 매출 증가를 물량과 가격으로 나눈 회사 공시 — 2026년
회사기간매출 증가물량가격
샌디스크FY2026 데이터센터(전년 대비)+437%출하 엑사바이트 약 +120%GB 당 매출 약 +150%101
샌디스크FY2026 4분기(전분기 대비)+51%증가분의 약 3분의 1증가분의 약 3분의 2102
마이크론FY2026 3분기 낸드(전년 동기 대비)+361%비트 출하 10%대 초반 증가평균판매가격 310%대 중반 상승103

트렌드포스는 1분기 한 분기에만 기업용 SSD 계약가격(큰 회사끼리 미리 정한 값)이 약 80% 뛰었다고 전했습니다99. 하지만 가격은 떨어진 적도 있습니다. 마이크론은 지난 5개 회계연도 동안 낸드 평균판매가격이 한 해에 +30%대 초반부터 −50%대 초반까지 움직였다고 적었습니다103. 가격이 제조원가(만드는 데 드는 돈) 아래로 떨어진 적도 있다고 직접 밝혔습니다103. 그때는 팔수록 손해였습니다.

수요가 늘어난 이유는 KV 캐시만이 아닙니다. 트렌드포스는 HDD(회전 원판에 기록하는 하드디스크)를 제때 못 구해 SSD 로 대신 산 수요104와 AI 학습 데이터 저장을 이유로 들었습니다99. 최근에는 북미 에이전트 AI 의 실시간 검색·캐싱과 벡터 데이터베이스(AI 가 비슷한 내용을 빨리 찾도록 정리한 자료 창고)도 꼽았습니다95.

KV 캐시를 수요 이유로 적은 회사 자료도 있습니다. SK하이닉스는 7월 미국 증시에 상장하며 투자설명서(주식을 사려는 사람에게 내놓는 회사 설명서)를 냈습니다. 여기서 KV 캐시를 시스템 메모리에서 SSD 로 내리는 흐름을 짚었습니다105. 그래서 eSSD 가 메모리 체계 안에서 중요한 칸을 맡게 됐다고 적었습니다105.

마이크론 경영진은 KV 캐시라는 말 대신 「AI 컨텍스트 메모리 스토리지」라는 말을 썼습니다. 이 말은 KV 캐시 저장장치를 가리키고, 경영진은 이것과 HDD 대체 수요로 SSD 시장이 넓어진다고 표현했습니다106.

SK하이닉스는 실적 발표에서 2분기 기업용 SSD 매출이 전분기의 두 배를 넘었다고 말했습니다(디일렉 전문)8. 솔리다임의 30TB 이상 제품 매출은 세 배 넘게 늘었다고 덧붙였습니다8. X 게시물과 쿠코인 뉴스에 따르면 미국 은행 씨티는 2027년 eSSD 수요가 52.9% 늘 것으로 봤습니다107108. 씨티는 그 이유로 AI 추론·지속 학습과 함께 KV 캐시 오프로딩(캐시를 GPU 밖으로 내려 두는 일)을 들었습니다107.

그러나 지금 매출에서 KV 캐시 몫만 따로 떼어 낸 숫자는 공개되지 않았습니다. 씨티 전망도 보도에는 전체 성장률만 나옵니다107. 앞으로 KV 캐시가 얼마나 차지할지는 샌디스크만 숫자로 내놓았습니다. 샌디스크는 8월 투자자 설명회에서 2030년 AI 데이터센터 낸드 시장을 1.2ZB(1ZB 는 10억 TB)로 내다봤습니다109. 그 가운데 35% 를 KV 캐시 몫으로 자체 추정했고, 2030년에 깔릴 영속 KV 캐시 용량도 1ZB 를 넘을 것으로 봤습니다109110.

지금 eSSD 매출 급등은 대부분 가격 상승에서 나왔습니다. KV 캐시 몫을 숫자로 떼어 낸 곳은 없습니다. 수요가 늘어난 이유도 HDD 대체, 학습 데이터, 에이전트의 검색과 캐싱, 데이터 준비처럼 여러 가지입니다. 근거는 트렌드포스의 2025~2026년 전망과 SK하이닉스 투자설명서입니다.

앞으로 KV 캐시가 차지할 몫은 샌디스크가 2026년 8월 투자자 설명회에서 낸 추정(2030년 35%) 하나뿐입니다. 파는 회사가 스스로 낸 추정이라, 사는 쪽 숫자로 확인된 것은 아닙니다. 그래서 KV 캐시 층이 이미 eSSD 매출을 만들고 있다고 단정할 수 없습니다. 가격 사이클이 꺾인 적도 있어, 지금 높은 매출이 계속된다고 볼 수도 없습니다.

캐시 형식 표준·관리 소프트웨어·보안, 남은 장벽

KV 캐시는 추론 엔진과 모델마다 저장 형식(저장하는 모양과 규칙)이 다릅니다. 형식이 맞지 않으면 SSD 에 저장해 둔 캐시를 다른 엔진이나 새 버전 엔진이 읽지 못해, 쌓아 둔 캐시가 쓸모없어집니다. LMCache 는 캐시를 저장하는 공개 소프트웨어입니다. 이를 만든 연구진의 논문에 따르면 2025년에는 주요 언어 모델이 평균 4일에 하나꼴로 나왔습니다(심사 전 논문)84. 논문은 엔진이 새 모델이나 칩에 맞춰 바뀔 때마다 캐시 형식도 따라 바뀐다고 지적했습니다84.

vLLM 은 실행 설정이 하나만 바뀌어도 캐시 폴더를 새로 만들고, 옛 폴더는 쓰지 않은 채 그대로 둡니다22. 쓰지도 않는 옛 캐시가 자리만 차지하는 셈입니다.

vLLM 과 또 다른 공개 추론 엔진 SGLang 은 캐시 이벤트(캐시를 만들거나 지웠다는 알림) 형식을 맞춰 가고 있지만 아직 네 군데가 다릅니다111. 2025년 7월 vLLM 에 올라온 KV 캐시 호환(서로 맞춰 쓸 수 있음) 표준 제안은 논의가 이어지지 않아 2026년 3월 끝났습니다112.

표준 단체에도 아직 전용 규격이 없습니다. 저장장치 업계 단체 SNIA 의 AI 저장 작업 목록에는 KV 캐시 전용 규격이 빠져 있습니다113. 8월 나온 NVMe(SSD 를 컴퓨터에 잇는 규격) 2.4 판 묶음에도 KV 캐시 전용 기능은 들어 있지 않습니다114. 모두가 따르는 규칙이 없으면 회사마다 따로 만들어 서로 맞춰 쓰기 어렵습니다.

9월 30일 SNIA 개발자 회의에는 KV 캐시를 여럿이 나눠 쓰는 방식을 다룬 발표가 잡혀 있습니다115. 발표 요지에는 이에 필요한 주고받는 규칙(프로토콜)·찾아보기 목록(색인)·정리 방식이 아직 개발 중이라고 적혀 있습니다115. 델도 같은 회의에서 추론 엔진과 배포 방식(프로그램을 서버에 깔아 돌리는 방식)이 서로 잘 맞지 않는 점을 근본 과제로 꼽을 예정입니다116.

엔비디아도 방향을 바꾸고 있습니다. 엔비디아는 9월 18일 추론 소프트웨어 Dynamo v1.5.0 에서 자체 KV 블록 관리 모듈(캐시 관리 부품)을 없애겠다고 예고했습니다117. 서버 메모리·디스크 층에는 각 엔진의 기본 기능을 쓰라고 안내했습니다117. 이 모듈은 작업에 따라 켜면 오히려 느려질 수 있어 원래 기본 설정에서 꺼져 있었습니다118. 캐시를 내려 두는 소프트웨어가 아직 자리를 잡지 못했다는 뜻입니다.

앞에서 본 회사들의 시험은 저장장치 회사가 자기 제품과 소프트웨어로 잰 값이었고, 보통의 추론 엔진에서는 처리 과정 탓에 캐시 복원이 훨씬 늦습니다. 고려대·KT 연구진은 기존 엔진이 SSD 에서 캐시를 되살리는 시간을 쟀습니다. 그 가운데 84% 가 운영체제(윈도처럼 컴퓨터 전체를 움직이는 기본 프로그램)의 파일 처리에 쓰였습니다(심사 전 논문)119. 128K 문맥의 첫 토큰은 30.7초 만에 나와, 흔히 기준으로 삼는 10초의 3배를 넘었습니다119. 연구진은 자체 설계로 이를 10초 안으로 줄였다고 밝혔습니다119.

새 엔진에서는 GPU 가 기다리는 시간이 걸림돌입니다. 자체 캐시 시스템 Tutti 를 낸 연구진이 새 버전 엔진을 재 봤습니다. SSD 에서 캐시를 되살려도 더는 재계산보다 이득이 없었습니다(심사 전 논문)120. 캐시가 GPU 메모리에 잘게 흩어져 있어 SSD 에서 아주 작은 조각을 수없이 읽어야 했습니다120. 그 읽기를 CPU 가 하나하나 챙기느라 GPU 가 손을 놓고 기다린 것입니다.

이 시험에서 GPU 가 기다린 시간은 전체 지연의 70% 를 넘었습니다120. 연구진은 Tutti 로 이 병목(좁아서 전체를 늦추는 곳)을 없애 D램 층 수준의 성능을 냈다고 주장했습니다120.

캐시를 관리하는 기능도 모자랍니다. LMCache 논문에 따르면 캐시를 찾고, 내보내고, 고정하고, 압축하는 일을 한데 관리하는 기능이 없습니다(심사 전 논문)84. 논문은 그 결과 캐시가 낭비되고 언제 지워질지 예측할 수 없게 된다고 봤습니다84. 9월에는 vLLM 에 캐시 보존·고정(지우지 말라고 표시해 두는 것) 정책을 넣자는 제안이 올라왔습니다121. 에이전트가 도구 결과(검색·계산을 시켜 놓고 기다리는 답)를 기다리는 사이 가장 중요한 캐시가 먼저 지워질 수 있다는 이유였습니다121.

여러 사용자가 캐시를 나눠 쓰면 보안에도 틈이 생깁니다. 첫 토큰 지연 차이를 재서 다른 사용자의 질문을 짐작할 수 있기 때문입니다122. 남이 같은 앞부분을 먼저 보냈다면 캐시가 남아 있어 내 답이 유난히 빨리 나오므로, 그 빠르기로 남이 무엇을 물었는지 가늠할 수 있습니다. 이를 막으려고 사용자끼리 캐시를 나눠 쓰지 못하게 격리하면, 나눠 쓰는 범위가 줄어 적중률이 떨어집니다122.

쓰기 수명 문제는 관리 기술로 풀 수 있다는 주장이 나온 정도입니다. 화웨이는 캐시가 얼마나 오래 쓰일지 예측해 저장 매체에 나눠 두는 기술로 SSD 수명을 16배 늘린다고 주장했습니다9. 스케일플럭스는 CMX 용 SSD 를 KV 부하에서 5년 동안 하루 7~10회 이상 쓰기를 견디도록 설계했다고 밝혔습니다123. 앞에서 본 QLC(하루 1회 이하)·TLC(1~3회)보다 훨씬 많은 쓰기입니다. 다만 결과는 작업에 따라 다르다고 덧붙였습니다123.

상용화(회사들이 실제로 사서 쓰는 물건이 되는 것)하려면 소프트웨어 표준과 쓰기 수명이라는 장벽을 먼저 넘어야 합니다. KV 캐시 형식은 엔진과 모델마다 바뀌고, 호환 표준 제안은 닫혔거나 엔진끼리 아직 맞지 않습니다. 표준 단체에서도 KV 캐시 전용 규격을 만드는 작업은 없습니다.

엔비디아는 Dynamo 의 자체 모듈을 없애겠다고 예고하고 각 엔진의 기능을 쓰라고 했습니다. 캐시를 내려 두는 기능을 켜면 오히려 느려지는 작업도 있었습니다. 캐시 관리 기능과 에이전트용 보존 정책은 아직 없고, 캐시를 나눠 쓰면 질문 내용이 샐 틈이 생깁니다. 쓰기 수명을 두고는 QLC 의 한계와 관리 기술로 늘릴 수 있다는 회사 주장이 맞서 있습니다.

매출이 확인될 시점과 판단을 바꿀 신호

일정은 나와 있습니다. 엔비디아는 8월 초 베라 루빈 양산 출하를 시작했고, 주요 클라우드와 서버 회사 모두에서 주문을 받았다고 밝혔습니다12480. 3분기 엔비디아 데이터센터 매출의 약 20% 는 루빈에서 나올 것으로 봤습니다80. CMX 가 들어간 STX 기반 파트너 제품은 2026년 하반기에 나올 예정입니다56.

다만 루빈 세대의 에이전트 작업 성능은 엔비디아가 직접 잰 값이고, 아직 외부 검증을 거치지 않았습니다. 캐시 불러오기와 재계산을 비교해 잰 값도 아닙니다125.

표 11. 관찰 지표와 2026년 9월까지 확인된 것
관찰 지표언제 보나지금까지 확인된 것
STX·CMX 파트너 제품 출하와 클라우드 도입파트너 제품이 나올 2026년 하반기부터도입 계획 8곳 발표2556
루빈 세대에서 불러오기와 재계산 비교 실측루빈 출하(2026년 8월 시작) 뒤 공개 측정블랙웰 세대(B300·GB300) 실측이 공개됨3739
AI 회사의 캐시 보존 시간각 사 문서가 바뀔 때오픈AI 24시간 기본(2026-05-29)49 · 앤트로픽 5분·1시간50 · 구글 시간당 보관료52
낸드 회사 실적의 KV·컨텍스트 메모리용 SSD 언급분기 실적 발표키옥시아 TLC CM87 · 샌디스크 고내구성 구성88 · 마이크론 「AI 컨텍스트 메모리 스토리지」106
가격이 멈춘 뒤 eSSD 출하 물량가격 상승이 멈춘 뒤의 분기 실적샌디스크 데이터센터 물량 약 +120%·가격 약 +150%101 · 마이크론 낸드 비트 10%대 초반 증가103
캐시 형식 표준과 관리 기능Dynamo 다음 판(v1.6.0) · SNIA 개발자 회의의 델·세레브라스 발표(9월 30일) · 엔진 제안의 결말KV 블록 관리 모듈 폐기 예고(v1.5.0)117 · vLLM·SGLang 형식 네 군데 어긋남111 · 에이전트 보존 정책 제안(9월)121

KV 캐시를 SSD 에 두었다가 불러오는 층(엔비디아 CMX 등)은 HBM 도 CPU D램도 대신하지 못합니다. 몇 분 안에 다시 쓰이는 캐시는 D램이 받습니다. 긴 대화나 에이전트 작업의 캐시는 사람이 결과를 읽고 생각하는 동안 몇 분에서 몇 시간 뒤에 다시 쓰이기도 합니다. SSD 는 이렇게 몇 시간 단위로 캐시를 보관했다가 되살리는 층이 됩니다. 요청이 짧으면 재계산이 더 빠릅니다.

이 층은 2026년 하반기 루빈 세대와 함께 파트너 제품으로 나오면서 기업용 SSD 수요를 보태는 요인이 됩니다. 다만 이 층이 낸드 회사 매출로 잡히기(장부에 판매액으로 올라오기) 시작하는 때는 빨라야 2026년 4분기~2027년입니다. 쓰기가 몰리는 층에는 고내구성 TLC 가, 용량을 맡는 층에는 QLC 가 쓰입니다. 이 층의 수요는 고내구성 제품과 대용량 기업용 SSD 를 둘 다 만드는 낸드 회사에 먼저 돌아갑니다. 다만 KV 부하에 쓰기가 많다는 판단은 솔리다임이 후원한 매체의 실측을 근거로 한 추정입니다.

그러나 지금의 eSSD 매출 급등은 대부분 가격 상승 덕분입니다. 이 층이 따로 만드는 매출은 2027년 CMX 출하량과, 가격 상승이 멈춘 뒤의 출하 물량에서 확인해야 합니다. 값이 오르는 동안에는 매출이 값 덕인지 양 덕인지 섞여 있기 때문입니다.

제품이 아직 나오지 않아 매출도 늦게 잡힙니다. 루빈은 8월 출하를 시작했지만 CMX 파트너 제품은 하반기에 나올 예정이고, 실제 출하는 아직 확인되지 않았습니다. 앞 세대 GPU 서버에도 이미 GPU 한 장당 3.84TB 의 로컬 SSD 가 들어 있습니다. CMX 가 여기에 SSD 를 얼마나 더 붙일지가 가장 중요한데, 공식 수치는 없습니다. GPU 한 장당 최대 16TB 라는 숫자는 Blocks & Files 보도에서 나왔습니다.

지켜볼 지표(판단에 쓸 눈금)는 여섯 가지입니다. 첫째, 2026년 4분기~2027년에 CMX 파트너 제품이 실제로 출하되고 클라우드 회사가 도입을 발표하는지입니다. 둘째, 루빈 세대에서 불러오기와 재계산을 비교한 결과입니다. 지금은 블랙웰 세대 결과까지만 있습니다.

셋째, 오픈AI·앤트로픽처럼 모델을 공개하지 않는 회사의 캐시 보존 시간입니다. 보존 시간이 길어질수록 SSD 층이 쓰일 곳도 늘어납니다. 넷째, 낸드 회사가 실적 발표에서 KV 캐시·컨텍스트 메모리용 고내구성 SSD 출하를 언급하는지입니다. 다섯째, eSSD 가격 상승이 멈춘 뒤에도 출하 물량이 늘어나는지입니다. 이 층이 따로 만드는 매출은 여기서 드러납니다.

여섯째, 상용화 전에 넘어야 할 소프트웨어 표준과 관리 기능입니다. Dynamo 모듈 정리, 엔진 사이의 형식 맞추기, 에이전트용 보존 정책이 어떻게 결론 나는지 보면 이 장벽을 넘는지 알 수 있습니다.

이 글은 SSD 층이 루빈 세대와 함께 기업용 SSD 수요를 보탤 것으로 보는데, 이 판단을 바꿀 신호는 세 가지입니다. 첫째, 모델 쪽 KV 축소가 SSD 영속 캐시를 계속 더 줄여 가는 경우입니다. 둘째, 에이전트가 아닌 짧은 요청이 계속 트래픽(AI 에게 오는 요청 전체) 대부분을 차지할 때입니다. 셋째, 루빈 실측에서 SSD 복원이 재계산보다 빠르지 못한 것으로 나올 때입니다. 이런 신호가 나오면 이 층은 D램 아래의 작은 보조 층에 머뭅니다.

참고자료

  1. 코리아중앙데일리 「SK hynix's Solidigm eyes $150B IPO as early as 2027, Reuters report suggests」(2026-09-26, 로이터 보도 인용) — https://www.koreajoongangdaily.com/business/sk-hynixs-solidigm-eyes-150b-ipo-as-early-as-2027-reuters-report-suggestsnbsp/12891770
  2. 야후 파이낸스 — 블룸버그 전재 「SK Hynix shares fall on Solidigm IPO report」(2026-09-27) — https://finance.yahoo.com/markets/stocks/articles/sk-hynix-shares-fall-solidigm-031013270.html
  3. 솔리다임 「What is CMX context memory storage」(2026-04-28) — https://www.solidigm.com/products/technology/what-is-cmx-context-memory-storage.html
  4. SK하이닉스 SEC 6-K 반기영업보고서(2026-08-18 제출) — https://www.sec.gov/Archives/edgar/data/2120882/000119312526354777/d147827d6k.htm
  5. 24/7 Wall St 「SK Hynix Drops 6% as Bloomberg Puts $100B Value on Potential Solidigm IPO」(2026-09-28) — https://247wallst.com/investing/2026/09/28/sk-hynix-drops-6-as-bloomberg-puts-100b-value-on-potential-solidigm-ipo-micron-and-western-digital-fall-4/
  6. SK하이닉스 Form 6-K(2026-09-04, 솔리다임 관련 해명) — https://www.sec.gov/Archives/edgar/data/2120882/000119312526382688/d111778d6k.htm
  7. 디엣지 말레이시아 — 로이터 전재 「솔리다임 IPO 검토」(2026-09-26) — https://theedgemalaysia.com/node/819450
  8. 디일렉 — SK하이닉스 2026년 2분기 실적 컨퍼런스콜 전문(2026-07-29) — https://www.thelec.kr/news/articleView.html?idxno=60209
  9. 화웨이 보도자료 「OceanStor M900 Context Memory Storage」(2026-09-17) — https://www.huawei.com/en/news/2026/9/hc-context-memory-storage
  10. 모닝스타 「SK하이닉스 미국 상장」 논평(2026-07-07) — https://www.morningstar.com/stocks/forget-spacexsk-hynixs-record-us-ipo-tests-ai-trades-hottest-corner
  11. 트레이딩키 「SK하이닉스 솔리다임 미국 상장」 분석 기사(2026-09-28) — https://www.tradingkey.com/analysis/stocks/us-stocks/262189264-skhynix-solidigm-ipo-us-listing-semiconductor-record-investors-tradingkey
  12. DeepSeek 「Insights into DeepSeek-V3」(ISCA '25 논문) — https://arxiv.org/pdf/2505.09343
  13. Mooncake(문샷 AI·칭화대) FAST '25 논문 — https://www.usenix.org/system/files/fast25-qin.pdf
  14. 엔비디아 H200 제품 페이지 — https://www.nvidia.com/en-us/data-center/h200/
  15. 엔비디아 기술 블로그 「Inside the NVIDIA Rubin Platform」(2026-01-05) — https://developer.nvidia.com/blog/inside-the-nvidia-rubin-platform-six-new-chips-one-ai-supercomputer/
  16. 엔비디아 기술 블로그 「Introducing NVIDIA BlueField-4-Powered Inference Context Memory Storage Platform」 — https://developer.nvidia.com/blog/introducing-nvidia-bluefield-4-powered-inference-context-memory-storage-platform-for-the-next-frontier-of-ai/
  17. vLLM 블로그 「vLLM AgentX」(2026-09-08) — https://vllm.ai/blog/2026-09-08-vllm-agentx
  18. vLLM 블로그 「vLLM × Mooncake Store」(2026-05-06) — https://vllm.ai/blog/2026-05-06-mooncake-store
  19. vLLM 원논문 「Efficient Memory Management for LLM Serving with PagedAttention」(SOSP '23) — https://arxiv.org/pdf/2309.06180
  20. vLLM 문서 「Optimization and Tuning」 — https://github.com/vllm-project/vllm/blob/main/docs/configuration/optimization.md
  21. vLLM 블로그 「Tiered KV Offloading」(2026-09-10) — https://vllm.ai/blog/2026-09-10-tiered-kv-offloading
  22. vLLM 문서 「KV Offloading」 — https://github.com/vllm-project/vllm/blob/main/docs/features/kv_offloading_usage.md
  23. CachedAttention(화웨이 클라우드·NUS) USENIX ATC '24 논문 — https://www.usenix.org/system/files/atc24-gao-bin-cost.pdf
  24. 엔비디아 보도자료 「BlueField-4 Powers New Class of AI-Native Storage Infrastructure」(2026-01-05) — https://nvidianews.nvidia.com/news/nvidia-bluefield-4-powers-new-class-of-ai-native-storage-infrastructure-for-the-next-frontier-of-ai
  25. 엔비디아 보도자료 「NVIDIA Launches BlueField-4 STX Storage Architecture」(2026-03-16) — https://nvidianews.nvidia.com/news/nvidia-launches-bluefield-4-stx-storage-architecture-with-broad-industry-adoption
  26. 엔비디아 CMX 솔루션 개요(2026년 6월판) — https://dam-cdn.nvd.orangelogic.com/AssetLink/055jkm0d3m418q268375lm13h20e7tx4.pdf
  27. 엔비디아 CMX 제품 페이지 — https://www.nvidia.com/en-us/data-center/ai-storage/cmx/
  28. Blocks & Files 「NVIDIA's basic context memory extension infrastructure」(2026-01-12) — https://www.blocksandfiles.com/2026/01/12/nvidias-basic-context-memory-extension-infrastructure/4090541
  29. 엔비디아 DGX GB200/GB300 사용자 가이드 「Hardware」 — https://docs.nvidia.com/dgx/dgxgb200-user-guide/hardware.html
  30. 마이크론 6600 ION 기술 사양서(Rev. A 09/2026) — https://www.micron.com/content/dam/micron/global/public/products/storage/ssds/data-center/6600/6600-ion-ssd-technical-product-specification.pdf
  31. VAST Data·래블업 블로그 「KV cache offload benchmark」 — https://www.vastdata.com/blog/vastdata-lablup-kvcache-offload-benchmark
  32. 엔비디아 기술 블로그 「How to Reduce KV Cache Bottlenecks with NVIDIA Dynamo」(2025-09-18) — https://developer.nvidia.com/blog/how-to-reduce-kv-cache-bottlenecks-with-nvidia-dynamo/
  33. 엔비디아 기술 블로그 「GH200 Superchip Accelerates Inference by 2x in Multiturn Interactions」(2024-10-28) — https://developer.nvidia.com/blog/nvidia-gh200-superchip-accelerates-inference-by-2x-in-multiturn-interactions-with-llama-models/
  34. IBM 리서치 블로그 「Accelerating AI inference with IBM Storage Scale」(2025-11-18) — https://research.ibm.com/blog/accelerating-ai-inference-with-ibm-storage-scale
  35. DeepSeek API 공지 「Context Caching on Disk」(2024-08-02) — https://api-docs.deepseek.com/news/news0802
  36. IBM 레드북 「Context Without Limits」(IBM·엔비디아·슈퍼마이크로) — https://www.redbooks.ibm.com/docs/MD260021/MD260021.html
  37. 네비우스 블로그 「Nebius·WEKA shared KV cache benchmark on HGX B300」(2026-09-24) — https://nebius.com/blog/posts/nebius-weka-shared-kv-cache-benchmark-hgx-b300
  38. WEKA 「Benchmarking WEKA on Nebius AI Cloud」 — https://www.weka.io/article/benchmarking-weka-on-nebius-ai-cloud
  39. 델 블로그 「Faster GPUs and Smaller Caches Raise the Bar for Storage」 — https://www.dell.com/en-us/blog/faster-gpus-and-smaller-caches-raise-the-bar-for-storage/
  40. 알리바바 「KVCache in the Wild」(USENIX ATC '25 논문) — https://arxiv.org/pdf/2506.02634
  41. KVCache.AI(Mooncake) 블로그 「Scaling KV Cache Beyond Memory」(2026-07-15) — https://kvcache.ai/blog/scaling-kv-cache-beyond-memory/
  42. KVCache.AI(Mooncake) 블로그 「KV 캐시 예산 계산」(2026-06-26) — https://kvcache.ai/blog/calculate-kvcache-cache-budge/
  43. SemiAnalysis 공개 데이터셋 「cc-traces-weka-042026」(Hugging Face) — https://huggingface.co/datasets/semianalysisai/cc-traces-weka-042026
  44. 워싱턴대 TraceLab(arXiv 2606.30560, 심사 전 논문) — https://arxiv.org/html/2606.30560v2
  45. 홍콩과기대·알리바바·바이트댄스 코딩 에이전트 트레이스 분석(arXiv 2608.15127, 심사 전 논문) — https://arxiv.org/html/2608.15127
  46. 문샷 AI 「Kimi K3 기술보고서」(2026-07-27, 심사 전 논문) — https://arxiv.org/html/2607.24653
  47. 오픈AI 쿡북 「Prompt Caching 201」 — https://developers.openai.com/cookbook/examples/prompt_caching_201
  48. 오픈AI API 문서 「Prompt caching」 — https://developers.openai.com/api/docs/guides/prompt-caching
  49. 오픈AI API 변경 기록(Changelog) — https://developers.openai.com/api/docs/changelog
  50. 앤트로픽 문서 「Prompt caching」 — https://platform.claude.com/docs/en/build-with-claude/prompt-caching
  51. 구글 Gemini API 문서 「Context caching」 — https://ai.google.dev/gemini-api/docs/generate-content/caching
  52. 구글 Gemini API 가격표 — https://ai.google.dev/gemini-api/docs/pricing
  53. DeepSeek API 문서 「KV Cache」 — https://api-docs.deepseek.com/guides/kv_cache
  54. DeepSeek-V4.1 기술보고서(arXiv 2609.19969, 2026-09-17, 심사 전 논문) — https://arxiv.org/pdf/2609.19969
  55. 추론 서비스 Chutes 1년 운영 기록 분석(arXiv 2608.13573, 심사 전 논문) — https://arxiv.org/pdf/2608.13573
  56. 엔비디아 보도자료 「Vera BlueField-4 STX」(2026-05-31, GTC 타이베이) — https://nvidianews.nvidia.com/news/nvidia-vera-bluefield-4-stx-brings-agentic-ai-storage-processing-with-in-silicon-security
  57. WEKA 보도자료 「Augmented Memory Grid」(2025-11-18) — https://www.weka.io/company/weka-newsroom/press-releases/weka-breaks-the-ai-memory-barrier-with-augmented-memory-grid/
  58. VAST Data 블로그 「How NVIDIA Dynamo + VAST Unlock Context Reuse at Scale」(2026-03-16) — https://www.vastdata.com/blog/how-nvidia-dynamo-vast-unlock-context-reuse-at-scale
  59. DDN 블로그 「DDN Becomes the First Storage Vendor Natively Integrated into NVIDIA KV Cache Management」 — https://www.ddn.com/blog/ddn-becomes-the-first-storage-vendor-natively-integrated-into-nvidia-kv-cache-management/
  60. AWS 스토리지 블로그 「Accelerate inference with KV cache tiering on AWS」(2026-09-21) — https://aws.amazon.com/blogs/storage/accelerate-inference-with-kv-cache-tiering-on-aws/
  61. 구글 클라우드 블로그 「Choosing Google Cloud Managed Lustre for your external KV cache」(2025-10-31) — https://cloud.google.com/blog/products/storage-data-transfer/choosing-google-cloud-managed-lustre-for-your-external-kv-cache
  62. Mooncake GitHub 저장소 README — https://github.com/kvcache-ai/Mooncake/blob/main/README.md
  63. Mooncake 논문 arXiv 판(2407.00079, 심사 전) — https://arxiv.org/pdf/2407.00079
  64. 델 보도자료 「Dell AI Data Platform with NVIDIA」(2026-03-16) — https://www.dell.com/en-us/dt/corporate/newsroom/announcements/detailpage.press-releases~usa~2026~03~dell-ai-data-platform-with-nvidia-supercharges-enterprise-ai-with-breakthrough-data-orchestration-and-storage-innovations.htm
  65. Lightbits Labs 보도자료 「Inferra」(2026-09-09) — https://www.lightbitslabs.com/press-releases/lightbits-rewrites-tokenomics-inferra-an-intelligent-kv-cache-orchestration-engine-debuts-at-ai-infra-summit/
  66. DeepSeek-V2 논문(arXiv 2405.04434) — https://arxiv.org/pdf/2405.04434
  67. DeepSeek-V4 기술보고서(arXiv 2606.19348, 심사 전 논문) — https://arxiv.org/pdf/2606.19348
  68. 엔비디아 기술 블로그 「Optimizing Inference for Long Context and Large Batch Sizes with NVFP4 KV Cache」 — https://developer.nvidia.com/blog/optimizing-inference-for-long-context-and-large-batch-sizes-with-nvfp4-kv-cache/
  69. 엔비디아 Vera Rubin NVL72 사양표 — https://www.nvidia.com/en-us/data-center/vera-rubin-nvl72/
  70. 엔비디아 GB200 NVL72 사양표 — https://www.nvidia.com/en-us/data-center/gb200-nvl72/
  71. 삼성전자 백서 「Optimizing KV Cache Offloading to CMM-D in a CXL Switch-based Memory Pool」(2026-06) — https://download.semiconductor.samsung.com/resources/white-paper/Optimizing_KV_Cache_Offloading_to_CMM-D_in_a_CXL_Switch-based_Memory_Pool.pdf
  72. 판메니아 보도자료 「ISPASS 기조연설」(2026-04-28) — https://panmnesia.com/news/en/2026-04-28-panmnesia-ispass-eng/
  73. 엑세나 보도자료 「MX1 Production Lineup」(2026-07-31) — https://www.financialcontent.com/article/bizwire-2026-7-31-xcena-unveils-mx1-production-lineup-to-accelerate-push-into-hyperscale-ai-infrastructure
  74. 디일렉 「삼성 CMM-D 3.0 양산 일정」(2026-07-07) — https://www.thelec.net/news/articleView.html?idxno=11999
  75. 샌디스크 보도자료 「SK하이닉스와 HBF 표준화 협력」(2025-08-06) — https://www.sandisk.com/company/newsroom/press-releases/2025/2025-08-06-sandisk-to-collaborate-with-sk-hynix-to-drive-standardization-of-high-bandwidth-flash-memory-technology
  76. SK하이닉스 뉴스룸 「HBF at FMS 2026」(2026-08-04) — https://news.skhynix.com/en/hbf-at-fms-2026/
  77. 샌디스크 블로그 「Scaling Beyond the Wall: Inside Sandisk's High Bandwidth Flash for AI」(2025) — https://www.sandisk.com/company/newsroom/blogs/2025/scaling-beyond-the-wall-inside-sandisks-high-bandwidth-flash-for-ai
  78. 스토리지리뷰 「Sandisk Tapes Out Its First HBF Memory Die」(2026-08-18) — https://www.storagereview.com/news/sandisk-tapes-out-its-first-hbf-memory-die-targets-2027-for-inference-product-samples
  79. 베이징대 HBF KV 오프로드 연구(arXiv 2608.11668, 심사 전 논문) — https://arxiv.org/pdf/2608.11668
  80. 엔비디아 2027 회계연도 2분기 실적 발표 전사본(2026-08-26) — https://s201.q4cdn.com/141608511/files/content_files/TRANSCRIPT_-NVIDIA-Corp-NVDA-US-Q2-2027-Earnings-Call-26-August-2026-5_00-PM-ET.pdf
  81. 마이크론 9550 NVMe SSD 기술 사양서 — https://assets.micron.com/adobe/assets/urn:aaid:aem:8c1e2b9b-d81a-45f0-9a9f-8edcd6c23ec9/renditions/original/as/9550-nvme-ssd-tech-prod-spec.pdf
  82. VU 암스테르담·IBM py-kvcache 연구(arXiv 2609.11744, 심사 전 논문) — https://arxiv.org/pdf/2609.11744
  83. 델 블로그 「KV Cache Offload to Object Storage: GPU Direct and Upstream」(2026-08-19) — https://www.dell.com/en-us/blog/kv-cache-offload-to-object-storage-gpu-direct-and-upstream/
  84. LMCache 논문(arXiv 2510.09665, 심사 전) — https://arxiv.org/pdf/2510.09665
  85. 스토리지리뷰 「The Token-Efficient Path for Long-Context Inference: KV Cache Offload to Flash」(2026-07-22, 솔리다임 후원) — https://www.storagereview.com/review/the-token-efficient-path-for-long-context-inference-kv-cache-offload-to-flash
  86. VU 암스테르담·IBM I/O 추적 연구(CHEOPS '25) — https://atlarge-research.com/pdfs/2025-cheops-llm.pdf
  87. 키옥시아 보도자료 「Investor Day」(2026-06-02) — https://www.kioxia-holdings.com/en-jp/news/2026/20260602-1.html
  88. 샌디스크 보도자료 「FMS 2026」(2026-08-04) — https://www.sandisk.com/company/newsroom/press-releases/2026/sandisk-nand-innovation-for-era-of-ai-inference-at-fms-2026
  89. 트렌드포스 보도자료(2026-03-13, 2025년 4분기 기업용 SSD) — https://www.trendforce.com/presscenter/news/20260313-12967.html
  90. 솔리다임 D5-P5336 제품 페이지 — https://www.solidigm.com/products/data-center/d5/p5336.html
  91. 삼성전자 반도체 기업용 SSD 페이지 — https://semiconductor.samsung.com/ssd/enterprise-ssd/
  92. 마이크론 보도자료 「245TB Micron 6600 ION Data Center SSD Now Shipping」(2026-05-05) — https://www.globenewswire.com/news-release/2026/05/05/3287806/14450/en/industry-leading-245tb-micron-6600-ion-data-center-ssd-now-shipping.html
  93. 솔리다임 D5-P5336 제품 브리프 — https://www.solidigm.com/content/dam/solidigm/en/site/products/technology/p5336-product-brief/documents/Solidigm-D5P5336-ProductBrief.pdf
  94. 트렌드포스 인사이트 「Why CSPs Are Turning to QLC SSDs for KV Cache Storage」(2026-09-24, 무료 공개 구간) — https://insights.trendforce.com/p/why-csps-are-turning-to-qlc-ssds
  95. 트렌드포스 보도자료(2026-09-21, 기업용 SSD 수요 전망 상향) — https://www.trendforce.com/presscenter/news/20260921-13246.html
  96. 디일렉 — 삼성전자 2026년 2분기 실적 컨퍼런스콜 전문 — https://www.thelec.kr/news/articleView.html?idxno=60316
  97. 북경대·알리바바 HBFlex 연구(arXiv 2609.18675, 심사 전 논문) — https://arxiv.org/pdf/2609.18675
  98. 트렌드포스 보도자료(2024-05-31, 2024년 1분기 기업용 SSD) — https://www.trendforce.com/presscenter/news/20240531-12160.html
  99. 트렌드포스 보도자료(2026-06-11, 2026년 1분기 기업용 SSD) — https://www.trendforce.com/presscenter/news/20260611-13092.html
  100. 트렌드포스 보도자료(2026-09-01, 2026년 2분기 기업용 SSD) — https://www.trendforce.com/presscenter/news/20260901-13210.html
  101. 샌디스크 FY2026 연차보고서(10-K) — https://www.sec.gov/Archives/edgar/data/2023554/000162828026057406/sndk-20260703.htm
  102. 샌디스크 FY2026 4분기 실적 보도자료(SEC 8-K 첨부, 2026-08-05) — https://www.sec.gov/Archives/edgar/data/2023554/000162828026053346/sndkq4-26ex991xpressrelease.htm
  103. 마이크론 FY2026 3분기 분기보고서(10-Q) — https://www.sec.gov/Archives/edgar/data/723125/000072312526000015/mu-20260528.htm
  104. 트렌드포스 보도자료(2025-09-15, HDD 부족과 QLC SSD) — https://www.trendforce.com/presscenter/news/20250915-12714.html
  105. SK하이닉스 미국 상장 투자설명서(424B4, 2026-07-09) — https://www.sec.gov/Archives/edgar/data/2120882/000119312526299963/d32785d424b4.htm
  106. 마이크론 FY2026 3분기 실적 준비발언(2026-06-24) — https://micron.gcs-web.com/static-files/631b1a32-5537-46ae-8f40-82e42fc79dfe
  107. X 게시물(@wallstengine) — 씨티 기업용 SSD 수요 전망 — https://x.com/wallstengine/status/2102340640017412190
  108. 쿠코인 뉴스플래시 — 씨티 기업용 SSD 수요 전망(2026-09-22, BlockBeats 전재) — https://www.kucoin.com/news/flash/citi-forecasts-53-surge-in-enterprise-ssd-demand-by-2027-driven-by-ai
  109. 샌디스크 투자자의 날 발표 자료 「AI Infrastructure Outlook」(2026-08-13) — https://investor.sandisk.com/static-files/9ee604b4-b810-4fba-bbd3-c4c605f690f9
  110. 스톡애널리시스 — 샌디스크 투자자의 날 2026 전사본 — https://stockanalysis.com/stocks/sndk/transcripts/708061-investor-day-2026/
  111. SGLang RFC #39991(2026-09-17) — https://github.com/sgl-project/sglang/issues/39991
  112. vLLM RFC #20492 「KV 캐시 상호운용 API 표준화」 — https://github.com/vllm-project/vllm/issues/20492
  113. SNIA Storage.AI 공식 페이지 — https://www.snia.org/storage.ai
  114. NVM Express 「NVMe 2.4 규격 묶음」 발표(2026-08-04) — https://www.financialcontent.com/article/bizwire-2026-8-4-nvm-express-publishes-set-of-nvme-specifications-enhancing-security-manageability-and-sustainability-for-ai-cloud-enterprise-and-client-storage
  115. SNIA SDC 2026 발표 요지(Cerebras·Dell/EMC, 세션 19672) — https://www.snia.org/sniadeveloper/session/19672
  116. SNIA SDC 2026 발표 요지(델, 세션 19774) — https://www.snia.org/sniadeveloper/session/19774
  117. 엔비디아 Dynamo 폐기 예고 목록(v1.5.0) — https://github.com/ai-dynamo/dynamo/blob/main/docs/fern/pages/reference/general/releases/deprecations.mdx
  118. 엔비디아 Dynamo 알려진 문제 목록 — https://github.com/ai-dynamo/dynamo/blob/main/docs/fern/pages/reference/general/releases/known-issues.mdx
  119. 고려대·KT SSD KV 복원 연구(arXiv 2606.14779, 심사 전 논문) — https://arxiv.org/pdf/2606.14779
  120. Tutti 연구(arXiv 2605.03375, 심사 전 논문) — https://arxiv.org/pdf/2605.03375
  121. vLLM RFC #57103(2026-09-16) — https://github.com/vllm-project/vllm/issues/57103
  122. vLLM 문서 「Security」 — https://github.com/vllm-project/vllm/blob/main/docs/usage/security.md
  123. 스케일플럭스 보도자료 「AI-Optimized SSD Platform Designed for NVIDIA CMX」(2026-07-30) — https://www.prnewswire.com/news-releases/scaleflux-introduces-ai-optimized-ssd-platform-designed-for-nvidia-cmx-and-kv-cache-offload-302838473.html
  124. 엔비디아 2027 회계연도 2분기 분기보고서(10-Q, 2026-08-26) — https://www.sec.gov/Archives/edgar/data/1045810/000104581026000075/nvda-20260726.htm
  125. 엔비디아 기술 블로그 「Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt」(2026-08-24) — https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/

본 보고서는 정보 제공 목적이며, 특정 종목의 매수·매도를 권유하지 않습니다. 모든 투자 판단과 책임은 투자자 본인에게 있습니다.

댓글 0

댓글을 작성하려면 로그인이 필요합니다.
  • 첫 댓글을 남겨보세요.
예시 데이터

아래 수치는 화면 예시용 고정 값이며 실시간 시세가 아닙니다.

DOW-1.42%S&P 500+0.45%NASDAQ 100+1.12%NVIDIA+4.12%APPLE-0.21%MICROSOFT+0.55%SEMICONDUCTOR_INDEX+2.45%BITCOIN-1.42%DOW-1.42%S&P 500+0.45%NASDAQ 100+1.12%NVIDIA+4.12%APPLE-0.21%MICROSOFT+0.55%SEMICONDUCTOR_INDEX+2.45%BITCOIN-1.42%