자유게시판
대충 개인용 로컬 LLM 장비에 안착을 한 듯 합니다.
그동안 Asus GX10(DGX SPARK), HP Z2 Mini G1a (Strix Halo 128GB)를 사용해왔습니다.
HP는 64GB는 시스템램에 할당, VRAM에 할당된 64GB는 QWEN Embedding Q8, QWEN Reranker Q8로 오픈클로의 메모리와 Ragflow의 RAG 시스템 담당, OCR로 PaddleOCR, ASR용 이런저런 잡모델을 올려 쓰고 있었습니다.
다만 GX10은 대용량 메모리 대비 속도가 너무 느려 MoE 모델을 쓸 수 밖에 없었고 QWEN3 CODER NEXT, QWEN3.6 35B A3B 여러 모델들을 올려 썼는데 좀.. 아쉽더군요.. 차라리 이 돈으로 구독료를 내자 싶은 생각이 들자마자 팔아버렸는데 배치용으로 주기적으로 AI를 돌려야 할 일이 생겨서... 다시 맞췄습니다.
- 델 7910 워크스테이션 (중고) : 오직 LLM 추론용이다보니 사양은 최대한 낮게...
- 엔비디아 GV100×2 (개봉중고) : 최신 기술은 못쓰고 구형 HBM이라 요즘 LPDDR보다 많이 느리지만 일단은 HBM이고 GX10보다는 빨라서... VRAM 합산 64GB 확보...
500 언더로 구성했는데 QWEN3.6 27B DENSE 모델 Q8 (KV캐시는 FP16)으로, 2슬롯에 각각 컨텍스트 200K씩 할당,
단일 추론에 40tok/s, 2슬롯 합산에 50tok/s 정도 나와줍니다.
다음주쯤 QWEN3.8 27B 소식이 있는데 이 모델은 또 얼마나 발전했을지.. 기대대봅니다.
(그나저나 별 하는일도 없는데 GPT 5.6 SOL은 Pro 20x 사용량 쭉쯕 빨아들이네요.. 덕분에 이번달은 Kimi K3 덕 좀 보고 있습니다. 수시로 장애가 생겨 메인모델로는 못쓰겠습니다만..)

댓글 0
첫 댓글을 남겨보세요.





