추론 능력이 희소한 자원이 될 때, 누가 그 가치를 차지하게 될까요?
chaincatcher저자: 프랭크 푸, IOSG
데이비드 칸이 2023년에 제기했던 "공백"은 학습 측면에서는 결코 채워지지 않았습니다. 추론 측면에서는 채워졌지만, 시장은 최근 몇 주 동안에야 비로소 이를 가격에 반영하기 시작했습니다. 엔비디아가 "서비스 토큰"을 중심으로 재무 보고 방식을 개편하고, 세레브라가 20배 초과 청약으로 상장했을 때, 병목 현상에 대한 논쟁은 이미 끝났고, 진정한 질문은 추론이 희소 자원이 되었을 때 컴퓨팅 스택에서 가치가 어디에 집중될 것인가가 되었습니다.
1. GPU의 진화: 2천억 달러에서 6천억 달러로
2023년, 세쿼이아 캐피털의 데이비드 칸은 전체 AI 인프라를 둘러싼 중요한 질문, 일명 "2천억 달러의 질문"을 제기했습니다. GPU에 1달러를 투자할 때마다 데이터 센터에서 GPU를 구동하는 데 약 1달러가 추가로 투자되어야 한다는 것입니다. 즉, 매년 GPU에 대한 자본 지출(CapEx)이 발생할 때마다 궁극적으로 약 2천억 달러의 매출을 올려야만 투자금을 회수할 수 있다는 의미입니다. AI 매출에 대해 매우 낙관적인 가정을 하더라도, 그는 "투자"와 "최종 고객의 실제 지불" 사이에 1,250억 달러 이상의 격차가 있음을 발견했습니다. 문제는 명확합니다. GPU가 실제 수요를 훨씬 앞지르며 과잉 생산되고 있다는 것입니다.
1년 후, 그 격차는 좁혀지기는커녕 오히려 벌어졌습니다. 2024년 후속 보고서에서 칸은 하이퍼스케일 업체들의 자본 지출이 급증하면서 이를 "6천억 달러짜리 질문"으로 재정의했습니다. 비관적인 논리는 익숙한 형태로 귀결되었습니다. 과잉 건설은 과잉 공급으로 이어지고, 과잉 공급은 자본을 소진시킨다는 것입니다.
두 기사 모두 본질적으로 같은 질문을 던지고 있습니다. 누가 이 공백을 메울 것인가? 그 답은 "훈련" 측면에서는 전혀 찾아볼 수 없었습니다. 오히려 추론 측면에서 나타나며, 시장은 지난 몇 주 동안에야 비로소 가격에 이를 반영하기 시작했습니다.
2. 세레브라스 IPO 및 추론 스퀴즈
세레브라스가 목요일에 기업공개(IPO)를 했습니다. 이번 IPO는 청약 경쟁률이 20배에 달했으며, 최종 공모가는 수요일에 발표된 가격 인상분의 거의 두 배에 육박했습니다. 이러한 수요는 '차기 엔비디아 킬러'에 대한 기대감에서 비롯된 것이 아니라, 인공지능의 진정한 병목 현상은 학습이 아니라 추론이라는 점을 시장이 이해하기 시작했기 때문입니다.
세레브라스의 특장은 추론 속도를 극도로 빠르게 만드는 칩 아키텍처입니다. 핵심은 학습이 아니라 추론입니다. 바로 이 점이 월스트리트를 들썩이게 하는 부분입니다. 추론 시장은 사용량이 증가함에 따라 지속적으로 확장됩니다. 클로드가 질문에 답할 때마다, 에이전트가 작업을 수행할 때마다 컴퓨팅 파워가 소모됩니다. 학습은 한 번만 이루어지지만, 추론은 결코 멈추지 않습니다.
JP Morgan은 추론 시장 규모가 학습 시장 규모의 10~50배에 달할 것으로 추정합니다. 기계가 다른 기계가 할당한 작업을 실행하기 시작하면, 즉 에이전트 기반 확장이 이루어지면 추론 수요는 더 이상 사용자 수에 비례하여 증가하는 것이 아니라 컴퓨팅 성능 자체에 비례하여 증가하게 됩니다.
3. 엔비디아, 판도를 바꾸다: 추론이 중심이 되다
세레브라스가 시장의 각성을 상징한다면, 엔비디아의 최근 분기 보고서는 공급망 최상단에서 나온 확증이라고 할 수 있습니다. 젠슨 황 엔비디아 CEO는 최근 실적 발표에서 암묵적인 진실을 명확히 밝혔습니다. 바로 AI 수요가 기하급수적으로 증가하고 있다는 것입니다. 그 이유는 간단합니다. 에이전트형 AI가 등장했기 때문입니다. 주류 AI는 일회성 추론에서 논리적 추론으로, 그리고 이제는 도구를 호출하고 스스로 작업을 조율할 수 있는 에이전트 단계로 진화했습니다. 황 CEO는 "이제 토큰이 수익성이 있다"고 말했습니다. AI 시대에 컴퓨팅 파워는 곧 수익과 이익으로 직결됩니다.
이는 업계 전체를 재편할 것입니다. 학습은 모델 구축에 드는 일회성 비용이지만, 추론은 모델을 실행하는 데 드는 지속적인 비용이며, 현재의 병목 현상은 학습이 아닌 추론에 있습니다.
엔비디아는 이러한 판단을 재무 보고에 반영했습니다. 이제 데이터 센터와 엣지 컴퓨팅이라는 두 가지 플랫폼으로 실적을 공개합니다. 데이터 센터(이번 분기 약 750억 달러, 전년 동기 대비 92% 증가)는 하이퍼스케일(약 380억 달러, 전분기 대비 12% 증가)과 AI 클라우드, 산업 및 엔터프라이즈를 포함하는 ACIE(약 370억 달러, 전분기 대비 31% 증가)로 세분화됩니다. 새롭게 추가된 엣지 컴퓨팅 부문은 64억 달러(전년 동기 대비 29% 증가)로, PC, 워크스테이션, AI-RAN 기지국, 로봇, 자동차 등 에이전트형 AI와 물리적 AI가 실제로 작동하는 엔드포인트를 포괄합니다.
현재 엣지 컴퓨팅은 전체 매출의 8% 미만을 차지하고 있지만, 엔비디아는 이를 데이터 센터와 함께 "제2의 플랫폼"으로 격상시켰습니다. 이는 추론이 두 가지 영역으로 나뉘고 있음을 시사합니다. 하나는 데이터 센터에서의 클라우드 추론이고, 다른 하나는 AI가 물리적 세계에서 보고, 움직이고, 행동해야 하는 엣지에서의 엔드포인트 추론입니다. 로드맵 역시 같은 논리를 따릅니다. 3분기 출시 예정인 Vera Rubin은 Blackwell보다 최대 35배 빠른 추론 처리량을 달성할 수 있습니다. 엔비디아의 CEO인 황 CEO는 에이전트 워크로드에 최적화된 Vera CPU의 총 시장 규모(TAM)를 2,000억 달러로 추산했습니다. 모든 주요 기업들이 출시 첫날부터 Vera CPU로 완전히 전환할 것으로 예상됩니다.
세계에서 가장 가치가 높은 기업이 "서비스 토큰"을 중심으로 재무 공시 방식을 재편함에 따라 병목 현상 논쟁은 이미 종결되었습니다. 이 글의 나머지 부분에서는 학습이 아닌 추론이 희소 자원이 될 때 누가 가치를 확보하는지에 대해 논의합니다.
먼저, 범위에 대한 설명부터 드리겠습니다. 이 글에서는 클라우드 추론, 즉 데이터 센터의 GPU를 임대하여 API 토큰 서비스를 제공하는 방식을 다룹니다. 엔드포인트 추론은 디바이스 자체의 로컬 칩(Nvidia의 Jetson, RTX, Drive, AI-RAN)에서 실행되므로, GPU 임대 및 집계 스택을 완전히 우회합니다. 따라서 이 글에서는 클라우드 추론을 전체 추론 경제를 활성화하고 병목 현상 논의를 뒷받침하는 요소로 간주해 주시고, Hyperbolic과 Venice가 운영하는 클라우드 시장과는 구분해 주시기 바랍니다.
4. 압박이 시작됐다
앤스로픽은 탄광 속 카나리아와 같습니다. 사용량이 사전 구성된 용량을 훨씬 초과하면서 클로드(Claude)가 "지능 추출"을 당하고 있다는 불만이 인터넷에 쏟아지고 있습니다. 응답 속도 저하, 추론 속도 저하, 컨텍스트 창 압축 등이 그 예입니다. 해결책은 명백히 컴퓨팅 파워에 있습니다. 2026년 5월, 앤스로픽은 22만 개 이상의 엔비디아 GPU와 300메가와트 이상의 전력을 갖춘 스페이스X의 콜로서스 1 데이터 센터 전체를 인수하여 학습이 아닌 추론에 전념하기로 했습니다.
이러한 역량 강화는 일련의 할당량 변경을 가능하게 했으며, 각 변경 사항은 신호 역할을 했습니다. 5월 6일, Anthropic은 Claude Code의 5시간 사용 제한을 두 배로 늘리고, 피크 시간대의 사용량 제한을 해제했으며, Opus의 API 사용량 제한을 크게 상향 조정했습니다. 5월 13일에는 Claude Code의 주간 사용량 제한을 50% 추가 상향 조정했습니다(7월 13일까지). 그리고 6월 15일부터는 "관대한" 정책과는 정반대의 조치를 취했습니다. 에이전트 및 프로그래밍 방식 사용(Agent SDK, 헤드리스 모드 claude -p, CI 파이프라인)을 정액 구독 방식에서 분리하여 독립적으로 사용량을 측정하는 크레딧 풀(월 20달러에서 200달러까지, API 사용량 기준)로 전환했습니다. 이 마지막 조치는 전체 논거를 하나의 행동으로 요약합니다. 즉, 에이전트가 추론 기능을 소비하는 속도가 정액 구독 방식의 설계 용량을 훨씬 초과하므로, 원래의 "반복 비용"에 따라 가격을 책정해야 한다는 것입니다.
교육은 일회성 자본 지출입니다. 추론은 반복적인 운영 비용이며, 새로운 사용자와 새로운 에이전트가 추가될 때마다 누적됩니다.
5. 이 스택: 6개의 층, 하나의 병목 현상
모든 AI 애플리케이션은 TSMC의 웨이퍼 제조에서 시작하여 API 최종 단계에 이르는 공급망 위에 존재합니다.


대부분의 회사는 이 스택의 한 계층만 소유하고 있습니다. 엔비디아는 실리콘을, 코어위브는 하드웨어를, 투게더 AI는 추론 최적화를, 오픈라우터는 모델 API 라우팅을 소유합니다.
단 한 가지 예외가 있습니다.
6. 하이퍼볼릭: 3개 층에 걸쳐 사업을 운영하는 유일한 회사
Hyperbolic은 2025년 6월에 온디맨드 GPU 마켓플레이스를 출시했습니다. 출시 후 몇 달 만에 개발자 수가 20만 명을 넘어섰으며, 최첨단 AI 연구소, 검색 엔진 및 대형 소비자 플랫폼을 아우르고 있습니다.
흥미롭게도, 그 건축 양식이 그렇습니다.
Hyperbolic은 GPU를 단 하나도 소유하고 있지 않습니다. 모든 그래픽 카드는 CoreWeave, Lambda Labs, Nebius를 비롯한 네오클라우드 및 데이터 센터와 유휴 용량을 보유한 소규모 운영업체에서 제공됩니다. 이는 약점처럼 보일 수 있지만, 실제로는 강력한 경쟁 우위 요소입니다.
Hyperbolic은 GPU 공급업체와 소비자 사이에 위치하여 다른 업체들이 볼 수 없는 실시간 데이터를 파악할 수 있습니다. 누가 어떤 GPU를 어떤 가격에 언제 구매하는지 알고 있으며, 공급 과잉이 공개되기 전에 이를 감지하고 수요 급증을 시장에 나타나기 전에 예측할 수 있습니다.
오늘날, 경쟁 우위를 확보하는 핵심 요소는 바로 이러한 멀티 클라우드 통합입니다. Hyperbolic은 수십 개의 독립적인 클라우드와 데이터 센터에 분산된 용량을 표준화된 통합 풀로 연결하여 개발자들이 각 운영자와 협상하거나 여러 계정을 관리할 필요 없이 어디서든 가장 저렴한 GPU를 임대할 수 있도록 합니다. 연결되는 클라우드가 많을수록 유동성이 풍부해지고 가격 데이터도 더욱 풍부해집니다. 나아가 Hyperbolic 팀은 이러한 데이터를 활용하여 GPU 가격 곡선을 모델링하고 궁극적으로 자체 자본을 투자하여 물리적 컴퓨팅 파워의 공급과 수요를 조절하는 시장 조성자 역할을 하는 방안을 모색하고 있습니다. 하지만 이러한 목표는 아직 초기 단계이며, 현재 진정으로 중요한 것은 바로 통합 계층입니다.
이것이 플라이휠입니다.
더 많은 클라우드를 연결하면 → 더욱 통합된 공급이 가능해집니다.
공급량 증가 → 더욱 심층적인 시장 및 실시간 가격 데이터
더 나은 데이터 → 더욱 스마트한 경로 설정 및 장기적인 가격 모델 구축
유동성 및 가격 개선 → 더 많은 개발자 → 더 많은 클라우드가 연결을 원함
다른 어떤 회사도 이러한 시도를 하지 않습니다. Hyperbolic은 GPU 임대 계층, 배포 계층 및 모델 API 계층을 모두 아우르는 유일한 회사입니다.
7. 거울로서의 베니스
Venice는 애플리케이션 계층에서 추론 경제를 가장 명확하게 보여주는 사례이며, Hyperbolic의 입장과 유용한 대조를 이룹니다. Venice는 개인정보 보호를 최우선으로 하는 추론 애플리케이션으로, OpenAI 호환 API 세트와 소비자 구독 서비스(무료/Pro/Pro+/Max)를 제공하며, 약 75개의 모델에 요청을 라우팅합니다. 이 중 3분의 2는 오픈 소스 또는 자체 호스팅 모델(Llama, Mistral, Qwen, DeepSeek)이고, 나머지는 최첨단 비공개 소스 모델을 익명으로 통과시키는 방식입니다. 핵심은 Venice가 실질적인 컴퓨팅 파워를 보유하지 않는다는 점입니다. 공개되지 않은 GPU 파트너 및 기밀 컴퓨팅 제공업체(NEAR AI Cloud, Phala)로부터 컴퓨팅 파워를 임대하고, 최첨단 연구소에 통과 비용을 지불하기 때문에, Venice의 실제 수익 비용은 SaaS 호스팅이 아닌 추론 컴퓨팅 파워에서 발생합니다.
베니스가 진정으로 판매하는 것은 프라이버시입니다. 여기서 "프라이빗화"는 공공 컴퓨팅 파워를 사유 재산으로 전환하는 것을 의미하는 것이 아니라, 상품화된 추론을 일련의 보장 계층으로 감싸는 것을 의미합니다. 데이터 보존 금지, 학습 금지, 요청 익명화, 그리고 일부 워크로드는 TEE(Trusted Execution Environment)에서 실행되어 운영자가 평문을 볼 수 없도록 합니다. 기본 컴퓨팅 파워는 일반적인 상품 수준이며, 가격은 이러한 프라이버시 패키징 계층에서 발생합니다. 더욱이, 이러한 보장은 계층화되어 있으며 균일하지 않습니다. 베니스가 관리하는 GPU 또는 TEE에서 실행되는 오픈 소스 모델의 경우 거의 종단 간 기밀 컴퓨팅을 달성할 수 있지만, Claude나 GPT와 같은 클로즈드 소스 모델의 익명 패스스루의 경우 프라이버시는 단순히 신원 정보만 제거할 뿐이며, 반대편의 최첨단 연구소는 여전히 사용자의 원래 프롬프트를 처리하고 있습니다. 따라서 가장 강력한 프라이버시는 오픈 소스 부분에만 적용되고, 최첨단 모델 부분은 "진정한 기밀성"이 아닌 "익명성"만을 제공합니다. 베니스의 총이익은 구독료에서 하위 단계에서 지불되는 추론 비용을 뺀 금액이며, 순수 API 가격 외에 추가로 청구할 수 있는 부분은 거의 전적으로 이러한 개인정보 보호 프리미엄에 의존합니다. 이것이 바로 베니스가 마진이 낮고 최첨단 패스스루 가격 책정 방식에 제약을 받는 이유입니다.
토큰 설계는 추론 수요의 이러한 부분을 패키지화했습니다. 베니스는 VVV(스테이킹 및 플랫폼 접근)와 DIEM이라는 두 가지 토큰으로 운영됩니다. DIEM은 추론 크레딧으로, 1 DIEM은 대략 1달러 상당의 일일 컴퓨팅 파워에 해당합니다. 유료 구독(Pro/Pro+/Max, 약 2달러/5달러/10달러)은 VVV의 프로그램적 바이백을 유발하며, 발행량은 정해진 일정에 따라 감소합니다. 매월 600만 → 500만 → 400만 VVV에서 감소하다가 7월 1일에는 300만 VVV로 조정됩니다. 바이백은 실제적이지만 재량에 따라 이루어지며 규모는 여전히 작습니다. 4월과 5월에는 각각 약 10만 3천 달러 상당의 바이백이 소각되었고, 6월에는 약 11만 달러까지 서서히 증가하고 있지만, 월간 목표치인 20만 달러에는 훨씬 못 미칩니다.
펀더멘털은 헤드라인보다 훨씬 건전합니다. 공개적으로 알려진 "연간 반복 매출(ARR) 7천만 달러"라는 수치는 구독 갱신을 신규 고객 확보로 오인한 결과일 가능성이 매우 높습니다. 실제 관찰 가능한 범위는 6백만 달러에서 1천5백만 달러 사이일 것입니다. 이보다 낮은 수치에서도 꾸준한 성장세는 확인할 수 있습니다. 약 13만 6천 개의 고유 지갑 주소, 월평균 약 990만 건의 웹사이트 방문(일평균 약 33만 건), 그리고 하루 평균 약 1,400건의 신규 프로 구독이 이루어지고 있습니다. 이는 분명히 사업이지만, 마진이 낮은 사업이며, 경제성은 구매하는 컴퓨팅 파워에 의해 제약을 받습니다.
바로 이러한 이유로 하이퍼볼릭은 베니스보다 한 단계 위에 위치합니다. 베니스가 주유소라면 하이퍼볼릭은 정유소와 같습니다. 베니스는 모두가 의존하는 제한된 공급원에서 컴퓨팅 파워를 구매합니다. 하이퍼볼릭은 이러한 분산된 공급을 통합하고 표준화하여 베니스와 같은 모든 사용자에게 판매합니다. 추론 수요가 증가함에 따라 컴퓨팅 파워를 소비하는 애플리케이션뿐만 아니라 컴퓨팅 파워를 통합하고 라우팅하며 이러한 애플리케이션이 지불하는 수익 비용을 확보하는 계층에도 가치가 축적됩니다.
8. 지금 이것이 중요한 이유
엔비디아는 "서비스 토큰"을 중심으로 재정 구조를 재편했습니다. 세레브라스의 IPO는 추론이 병목 현상이라는 점을 시장이 인지하고 있음을 보여줍니다. 앤트로픽의 필사적인 용량 확보 노력은 이것이 심각한 문제임을 입증합니다. 에이전트형 및 물리적 AI는 클라우드와 엣지 컴퓨팅 분야 모두에서 수요를 몇 배로 증폭시킬 것입니다.
게다가, 이는 "6천억 달러짜리 질문"에 대한 또 다른 관점을 제시하며 궁금증을 해소했습니다. 과잉 생산이 과잉 공급으로 이어진다는 칸의 비관적인 논리는 타당성이 입증될 가능성이 높습니다. 하지만 과잉 공급은 자산 경량형 애그리게이터에게는 최적의 시나리오입니다. GPU 가격이 하락하고 공급이 수십 개의 클라우드로 분산되면, 하드웨어를 전혀 보유하지 않고 모든 워크로드를 가장 저렴한 카드로 라우팅하는 업체가 가격 차익을 얻는 반면, 가치가 하락하는 GPU를 보유한 업체는 손실을 감수하게 됩니다. 하이퍼볼릭은 과잉 공급에 베팅하는 것이지, 공매도하는 것이 아닙니다.
궁극적으로 승리하는 회사는 가장 많은 GPU를 보유한 회사가 아니라, 어떤 GPU가 어디에서 어떤 가격으로 이용 가능한지 알려주고, 모든 작업 부하를 가장 저렴한 비용으로 실행할 수 있는 곳으로 라우팅할 수 있는 회사일 것입니다.
Hyperbolic은 바로 그런 회사를 구축하고 있습니다. GPU를 소유하지 않고, 순전히 소프트웨어 기반으로 작동하며, 세 개의 계층으로 구성되어 있지만, 추론 컴퓨팅 성능을 위한 궁극적인 통합 계층으로 성장하고 있습니다.
이 콘텐츠는 정보 및 교육 목적으로만 제공되며 BTCC와 관련된 투자 자문을 하지 않습니다. BTCC는 위 내용의 진실성, 정확성 및 독창성을 보장하기 위해 최선을 다하지만, 보장할 수는 없습니다.