Budget
+15%
Whole system
Single accelerator deployment allows cost-effective serving for smaller models like 8B-70B.
VRAM
128GB
Llama 3.1 70B
~45 tok/s
Provides a dedicated hardware path for inference whereas current systems might rely on less efficient GPU offloading
- Hardware
After (new)
1x Intel Gaudi 3 HL-325L (128GB HBM2e)