AI 인프라에 쓰는 모든 돈을 추적하고 있습니다. 작년에 한 항목이 계속해서 증가했습니다: 클라우드 GPU 임대료였죠. 3분기에는 월 $1,900에 도달했고, 그 비용을 발생시킨 작업에 대해 제가 고객에게 청구서를 보내고 있었습니다.
그 계산은 맞지 않습니다. 운영 비용의 40%를 남의 데이터 센터에 넘겨주면서 사업을 키울 수는 없습니다.
그래서 DGX Spark를 샀습니다. 내역은 이렇습니다.
1 / DGX Spark가 실제로 무엇인가
NVIDIA는 2025년 내내 데이터 센터 하드웨어를 데스크탑으로 압축하는 데 집중했습니다. 1월 CES에서 Project DIGITS로 발표했고, 3월 GTC에서 DGX Spark로 이름을 바꿨으며, 10월에 출하를 시작했습니다. 그 결과는 150×150×50mm 크기에 무게 1.2kg, 일반 벽면 콘센트로 작동하는 박스입니다.
사양:
구성 요소
세부 사항
칩
GB10 Grace Blackwell Superchip
AI 연산
1 PFLOP (FP4)
CPU
20코어 ARM (Grace)
메모리
128GB LPDDR5x, 통합
스토리지
4TB Gen5 NVMe
네트워킹
ConnectX-7 (두 대 연결 가능)
전력 소비
~150–240W (부하 시)
가격
$2,999
페타플롭 수치는 마케팅 수치입니다. 실제로 중요한 숫자는 128GB 통합 메모리입니다.
소비자용 GPU는 한계가 명확합니다. 4090은 24GB VRAM을 제공합니다. 모델이 그보다 크면 로드되지 않습니다. 5090은 한계를 32GB로 높입니다. Spark는 이를 128GB로 설정하여, $2,000짜리 소비자용 카드로는 열어볼 수도 없는 모델을 실행합니다.
2 / 메모리 장벽, 설명
128GB 통합 메모리가 실제로 가능하게 하는 것은 다음과 같습니다:
- Llama 3.3 70B - 전체 BF16 정밀도, 양자화 트릭 불필요
- Qwen 3 (30B–110B 범위) - 깔끔하게 맞춤
- DeepSeek급 모델 최대 200B - 양자화하여 안정적으로 실행
- FLUX.1 이미지 생성 - 가능
- 405B 파라미터 - ConnectX-7로 연결된 Spark 두 대
소비자용 GPU는 간신히 30B 정도에서 한계에 부딪힙니다. Spark는 정확히 그 한계가 끝나는 지점에서 시작합니다. 그 차이가 바로 하나를 구매하는 전체 이유입니다.
3 / 계산: $22,000이 어디서 나오는가
진지한 AI 워크로드를 위한 클라우드 GPU 비용:
작업
월 비용
A100 80GB, 파트타임
$600–$1,200
H100 파인튜닝 실행
$1,000–$2,500
호스팅된 70B 추론
$300–$900
종료하는 걸 깜빡한 인스턴스
깜짝 비용
AI 빌더의 현실적인 총액
$1,500–$3,000
동일한 워크로드의 DGX Spark:
항목
비용
하드웨어
$2,999 (일회성)
~200W 전력
$8–15/월
클라우드 임대료
$0
구매 후 월 비용
~$10
월 $1,900의 클라우드 비용에서 Spark는 7주 이내에 본전을 뽑습니다.
그 이후: 매달 사업장을 떠나던 $1,890가 사업장에 남습니다. 동일한 고객 작업에 대해. 동일한 청구서가 발행됩니다.
1년 동안 사업장으로 환원된 총액: $22,680.
4 / 소프트웨어 계층은 문제가 아님
Spark는 DGX OS를 실행합니다 - NVIDIA의 Ubuntu 빌드에 전체 AI 스택이 사전 로드됨: CUDA, NIM, NeMo. Ollama, vLLM, PyTorch, Hugging Face, llama.cpp 모두 첫날부터 수정 없이 실행됩니다.
이미 클라우드 엔드포인트를 사용하고 있었다면, 마이그레이션은 한 줄 변경입니다:
1# Before: paying by the hour2client = OpenAI(base_url="https://some-gpu-host/v1", api_key="sk-...")34# After: your desk, meter off5client = OpenAI(base_url="http://localhost:11434/v1", api_key="local")
동일한 코드 경로. 동일한 JSON 출력. 동일한 동작. 청구되는 것은 없습니다. 건물 밖으로 나가는 것도 없습니다.
5 / 비용 절감을 넘어선 비즈니스 사례
Spark는 단순한 비용 절감 도구가 아닙니다. 이전에는 너무 비싸서 자유롭게 실행할 수 없었던 작업에 대한 경제적 장벽을 제거합니다.
고객을 위해 AI 작업을 하는 경우:
예전에 $400 클라우드 비용이 들던 파인튜닝 실행이 이제는 무료입니다. 밤새 실행하세요. 다른 하이퍼파라미터로 세 가지 변형을 실행하세요. 아침에 청구서가 도착하지 않습니다. 클라이언트의 전체 독점 코드베이스에 걸쳐 비공개 코딩 에이전트를 배포하거나, 전체 팀이 사용하는 상시 작동 어시스턴트를 배포할 수 있습니다. 단위 비용은 전기 요금이지 API 토큰이 아닙니다. 첫 번째 고객 이후의 모든 고객은 순수 마진입니다.
민감한 데이터를 처리하는 경우:
대부분의 사람들이 과소평가하는 부분입니다. 계약서. 법률 문서. 환자 기록. 재무 데이터. 공개 API에 절대 넣지 않을 NDA가 적용되는 모든 것. Spark에서는 해당 데이터가 네트워크를 벗어나지 않습니다. 완전히 소유한 기계에는 서비스 약관이 적용되지 않습니다.
"귀하의 데이터는 건물 밖으로 나가지 않습니다"라는 말은 클라우드 공급업체가 절대 건드릴 수 없는 규제 산업 거래를 성사시킵니다. 법률 사무소, 클리닉, 재정 고문 - 이러한 고객은 그 보장에 상당한 프리미엄을 기꺼이 지불할 것입니다.
아무도 언급하지 않는 사고방식의 전환:
클라우드 가격 책정은 컴퓨팅을 아끼도록 훈련시킵니다. 에이전트가 루프를 돌게 하기 전, 전체 아카이브를 다시 실행하기 전, 작동하지 않을 수도 있는 아이디어를 튜닝하기 전에 망설이게 됩니다. 모든 실행에는 달러 비용이 붙어 있기 때문에 실행 횟수가 줄어듭니다.
박스를 소유하면 그 망설임이 사라집니다. 대부분의 경우, 최고의 작업은 그 망설임 뒤에 있었습니다.
6 / Spark가 아닌 것
한계에 대해 솔직히 말씀드리자면:
- 원시 속도 - 5090은 32GB VRAM에 맞는 모든 작업에서 더 빠릅니다
- 규모 - 수천 명의 동시 사용자 서비스는 여전히 데이터 센터 작업입니다
- 405B를 초과하는 프론티어 모델 - 연결된 Spark 두 대는 405B를 처리합니다. 그 이상은 다른 하드웨어가 필요합니다
- 소량 사용자 - API 호출에 월 $20을 지출한다면, 이것은 적절한 도구가 아닙니다
솔직한 기준: 월 $1,000+의 클라우드 GPU 지출이 Spark를 명백한 선택으로 만드는 지점입니다. 월 $500 미만이라면, 소비자용 카드나 API 액세스가 더 현명한 선택입니다. 이 박스는 진지한 워크로드에 적합하며, 가벼운 사용에는 적합하지 않습니다.
7 / 다양한 지출 수준에서의 회수 기간
월 클라우드 비용
회수 기간
$1,900/월
~6주
$1,000/월
~3개월
$500/월
~6개월
$200/월
클라우드 유지
8 / 더 넓은 그림
2024년에는 70B 모델을 실행하려면 데이터 센터나 월 $1,900의 클라우드 요금이 필요했습니다. 2026년에는 $2,999짜리 책 크기 박스와 벽면 콘센트만 있으면 됩니다.
NVIDIA는 의도적으로 DGX Spark를 $2,999에 책정했습니다. 그들은 차세대 AI 제품이 자사의 실리콘 위에, 로컬에서, 대규모로 구축되기를 원합니다. Jensen은 초기 유닛을 Musk와 Altman에게 직접 전달했습니다. Dell, HP, ASUS, Lenovo 모두 자체 GB10 기계를 구축하고 있습니다. 소프트웨어 스택은 거의 매주 이 칩에 맞게 조정됩니다.
클라우드 GPU 요금은 하락하지 않고 있습니다. 데이터 프라이버시 요구 사항은 강화되고 있습니다. 고객들은 서명하기 전에 자신의 데이터가 물리적으로 어디로 가는지 점점 더 묻고 있습니다.
2026년에 책상 위에서 프론티어급 모델을 실행하는 사람들은 2028년에 선견지명이 있었다고 평가받을 것입니다.
산수는 간단합니다: $2,999 한 번 대 월 $1,900. 박스는 1분기가 끝나기 전에 본전을 뽑고, 그 후에는 필요할 때까지 월 $10으로 작동합니다.
그것이 트레이드오프입니다. 1년 전에 이 선택을 했더라면 좋았을 텐데요.
도움이 되셨다면 @cryptowluha를 팔로우해주세요.
묻히기 전에 북마크하세요. 도움이 되셨다면, 필요로 하는 한 사람과 공유해주세요.





