NOTE
- 비영리단체가 M3 Ultra 512GB를 획득, 추천 모델로 oMLX + GLM 5.2 조합이 부상
- 16GB VRAM 환경에서는 Qwen 3.6 35B-A3B(MoE)가 일상·코딩 모두에서 인기
- 대학 A100 80GB 클러스터에서는 DeepSeek Flash (VLLM) 또는 Qwen 3.6 27B가 추천됨
- RTX 3090 24GB 사용자는 Qwen3.6 35B 및 Gemma4:12B를 주력으로 사용
- GLM 5.2는 Kimi 2.7보다 요청당 토큰 소모가 많지만, 성능과 컨텍스트(1M) 우위
비영리단체 M3 Ultra 512GB: 최적 모델은? (추천 31 · 댓글 32)
한 비영리단체가 M3 Ultra(512GB 통합 메모리)를 확보하고 Ollama 기반 추론 환경을 구성 중이다. 글쓴이는 전 세계 3개 시간대에서 VPN으로 공유되는 이 시스템을 8시간씩 혼자 쓴다. 항상 메모리에 상주시킬 주 모델을 추천받고 싶어 했다.
댓글은 Ollama 대신 oMLX를 쓰라는 쪽으로 기울었다. 특히 최신 oMLX 0.4.5.dev1에서 GLM 5.2 모델을 실행하면 코딩 품질이 크게 좋아진다는 경험담이 올라왔다. 한 사용자는 “이 하드웨어는 GLM 5.2를 위해 만들어졌다”며 설치 과정을 상세히 안내했다. 다만 일부 사용자는 Ollama에서도 GLM의 양자화 버전을 확인해보라고 조언했다. 원문
Intel Core Ultra 7 + RTX 5060 Ti 16GB: 일상 및 코딩 모델 (추천 26 · 댓글 13)
글쓴이는 64GB RAM과 RTX 5060 Ti 16GB를 갖췄다. 메일 재작성, 감정 분석, 표면적 조사 등 일상 업무와 PowerShell, SCAD, Dockerfile 등 코딩에 쓸 모델을 찾는 중이다. 2~3개 모델로 모든 작업을 처리하는 ‘데일리 드라이버’를 원했다.
댓글에서 가장 많이 이름이 나온 모델은 Qwen 3.6 35B-A3B(MoE)였다. 12GB VRAM에서도 23t/s가 나온다는 후기가 올라왔다. 35B-A3B는 전문가(3B)만 VRAM에 올라가므로 16GB 환경에 잘 맞는다고 봤다. Gemma 4 26B도 MoE 모델이라 대안으로 꼽은 사람도 있었다. Ollama 대신 llama.cpp를 권하는 의견도 있었다. 원문
대학 A100 80GB 클러스터: Qwen3.5 27B 결과 실망, 더 좋은 모델? (추천 11 · 댓글 14)
대학 연구실의 A100(80GB) 클러스터를 쓰는 글쓴이는 현재 Qwen3.5:27B에 실망했다. 특히 Bash 명령어를 실행할 때 파일명에 오타가 난다고 지적했다. 더 나은 모델과 컨텍스트 윈도우를 추천해 달라고 했다.
댓글에서는 DeepSeek Flash(4비트 양자화)를 VLLM으로 서빙하라는 제안이 나왔다. 다른 사용자는 Qwen 3.6 27B(3.5 아님)가 코드 작성에서 SOTA라고 답했다. 일반 목적이라면 122B-A10B의 4비트 양자화가 A100에 잘 맞는다고 덧붙였다. 시스템 RAM이 256GB 이상은 돼야 GPU 오프로드가 원활하다는 조언도 뒤따랐다. 추론 온도 같은 하이퍼파라미터 설정이 중요하다며 링크를 건 사람도 있었다. 원문
RTX 3090 24GB: 어떤 모델을 돌릴 수 있나? (추천 32 · 댓글 21)
글쓴이는 RTX 3090(24GB)을 싸게 구해 로컬 AI 모델을 돌릴 수 있는지 물었다. 특히 종합 성능용과 코딩용 모델을 나눠서 추천받고 싶어 했다.
댓글에서 추천이 가장 몰린 조합은 Qwen3.6:35B와 Gemma4:12B 세트였다. 12GB VRAM에서도 Qwen3.6 35B가 돈다는 후기가 올라왔다. GitHub 저장소 club-3090이 가장 종합적인 리소스로 꼽혔다. 이 저장소에는 듀얼/쿼드 3090 설정용 구성도 들어 있다. 12GB 3060 사용자를 위한 비슷한 저장소가 있느냐고 묻는 댓글도 달렸다.
원문
GLM 5.2 사용량: 1681 요청이 Kimi 2.7의 6000 요청보다 더 많은 컴퓨트를 소모 (추천 102 · 댓글 32)
한 사용자가 GLM 5.2가 1681회 요청에서 Kimi 2.7 코드 모델(6000회 요청)보다 GPU 사용량이 더 많았다고 지적했다. 첨부 이미지를 보면 세션 사용률 20.3%, 주간 사용률 82%(GLM 5.2 기준)다.
댓글 다수는 GLM 5.2가 정확도를 더 끌어올리려고 토큰과 검증 계층을 더 많이 쓰기 때문이라고 봤다. 두 모델 다 MoE지만 GLM은 토큰당 40B, Kimi는 32B를 쓴다는 차이도 나왔다. GLM은 1M 컨텍스트를 지원하는 반면 Kimi는 256K라 컨텍스트가 길어질수록 GPU 시간이 더 든다는 분석도 붙었다. 한 사용자는 “짧은 요청 하나도 1회로 카운트되므로 단순 비교는 무의미하다”고 반박했다. 원문
출처
- 비영리단체 M3 Ultra 512GB 최적 모델 추천 — r/ollama, u/neurostream
- Intel + RTX 5060 Ti 16GB 일상 및 코딩 모델 — r/ollama, u/Flying-T
- 대학 A100 80GB 클러스터 모델 추천 — r/ollama, u/NightLockX80
- RTX 3090 24GB 모델 추천 — r/ollama, u/wildweasel2026
- GLM 5.2 사용량 비교 — r/ollama, u/oleg_photos