NOTETL;DR
- GLM-5.2가 300+ TPS 속도와 “Opus 4.8급” 코딩 성능 평가로 화제 — 저예산($2500 이하)부터 Threadripper+듀얼 5090까지 로컬 실행 실험이 이어짐.
- Qwen3.6-27B는 “Claude Code 구독 대체” 논의의 중심 — 양자화 수준(IQ4_XS vs Q8)에 따른 품질 논쟁, 코딩 버그 누적 대처법 공유.
- KVFlash 기술로 Qwen3.6-27B 토큰 속도 2배·VRAM 21→17.5GB 감소 주장, 정확도 유지 여부엔 의구심도.
- Qwen-AgentWorld-35B-A3B는 일반 추론용이 아닌 에이전트 환경 시뮬레이션 특화 모델.
- SWE-rebench 리더보드 업데이트: Claude Opus 4.8 xhigh 56.5%, GLM-5.2 51.1%, 로컬 모델 중 Qwen3.6-27B 36.5%.
GLM-5.2 돌풍
GLM5.2, 빠른 속도와 코딩 성능 주목
레딧 r/ZaiGLM 커뮤니티의 한 사용자는 GLM5.2가 초당 300 토큰 이상을 처리한다며 ‘Opus 4.8만큼 좋다’고 평가했다. 특히 코딩 루프 작업에서 성능이 뛰어났다고 강조했다. 공개된 벤치마크나 상세 비교 없이 개인 체험에 기반한 주장이다. 이 글은 추천 135개와 댓글 60개를 받았다. 댓글에서는 “프론트엔드 작업은 부족하다”며 한계를 짚는 반응이 많았다. 한 사용자는 “파인튜닝이 가능하면 진정한 괴물이 될 것”이라고 평가했고 다른 사용자는 Wafer(openrouter.ai/provider/wafer)로 300 TPS를 경험했다고 전했다. 속도와 코딩 성능을 두고는 대체로 긍정적이었지만 멀티모달 기능이 없다는 아쉬움도 섞였다. 원문
$2500 예산으로 GLM-5.2 실행 가능한 구성 (추천 267 · 댓글 300)
글쓴이는 Epy CPU, 2x P40 24GB, 512GB DDR4 등 총 $1920 구성으로 GLM-5.2의 Q2/Q3/Q4 양자화 모델을 돌릴 수 있다고 주장했다. 속도는 느려도 에이전트 작업 대신 계획 수립이나 디버깅에는 쓸 만하다는 입장이다. 댓글 다수는 실제 속도가 1~2 tok/s에 불과할 것이라고 추정했고 “하루에 한 작업”이라는 비판도 달렸다. 일부는 4x 3090과 48코어 Epyc에서 Q4 기준 7t/s를 얻었다는 경험을 전했다. 원문
Threadripper + 5090에서 GLM-5.2 Q5_K_S 12t/s (추천 99 · 댓글 109)
32C Threadripper Pro 9975WX, 512GB DDR5, 듀얼 RTX 5090에서 GLM-5.2의 UD-Q5_K_S(492GB)를 Q5_K_S 양자화로 돌려 12t/s를 기록했다. 프롬프트 처리 속도는 약 30 tok/s로 느린 편인데 vLLM이나 DeepSeek4의 2000 tok/s 이상과 비교하면 현저히 낮다. 이 설정을 “컨슈머 하드웨어”로 볼 수 있는지 댓글에서 논쟁이 붙었고 프롬프트 처리 속도가 주요 병목이라고 짚는 반응도 있었다. 원문
Qwen3.6-27B 생태계
Qwen3.6-27B: 로컬 코딩 모델로 주목 (추천 130 · 댓글 91)
글쓴이는 100GB VRAM 환경에서 Claude Code를 대체할 로컬 모델을 찾다가 Qwen3.6 27B를 추천받았지만 더 뛰어난 모델을 원한다. 댓글에서는 Qwen3-Coder-Next가 코딩에 더 잘 맞고 빠르다는 쪽이 우세했고 Qwen 3.6 27b면 이미 충분하다는 반박도 나왔다. 원문
Claude Code 구독 대체를 위한 Qwen3.6-27B Q8 (추천 249 · 댓글 226)
글쓴이는 M5 Pro 48GB로 Qwen3.6-27B Q8을 구동해 Claude Code를 대체할 계획을 묻는다. 댓글에서는 Qwen이 코딩에 쓸모는 있지만 계속 손이 간다는 평이 많았고 48GB로는 Q8과 컨텍스트를 함께 감당하기 어렵다는 지적도 뒤따랐다. 일부는 Claude를 설계자로, Qwen을 코더로 나눠 쓰는 방식을 소개했다. 원문
RTX 3080 20GB에서 Qwen3.6-27B 실행 성능 (추천 52 · 댓글 44)
한 사용자는 RTX 3080 20GB에서 Qwen3.6-27B를 IQ4_XS 양자화로 210K 컨텍스트, 57 tok/s에 돌린 사례를 올렸다. 댓글에서는 IQ4_XS 양자화가 품질을 떨어뜨린다는 비판이 많았고 Q4_K_M 이상을 권장하거나 아예 35B 모델을 쓰는 편이 낫다는 반응이 이어졌다. 원문
KVFlash: Qwen3.6-27B 속도 2배, VRAM 17.5GB로 감소 (추천 438 · 댓글 131)
Luce의 KVFlash 기술을 적용하면 RTX 3090에서 Qwen3.6-27B Q4_K_M이 38.6 tok/s, VRAM 17.5GB(기존 21GB)로 돌아간다. 글쓴이는 니들 리콜 88-100%, harness 정확도는 36/36으로 동일하다고 주장했다. 댓글에서는 정확도 벤치마크가 실제 성능을 충분히 반영하지 못한다며 의구심을 드러냈고 Luce의 접근 방식이 ‘vibe coding’ 수준이라는 비판도 나왔다. 원문
Qwen3.6-27B 코딩 버그 대처법 (추천 111 · 댓글 143)
글쓴이는 Qwen3.6-27B로 코드를 짜다 보니 작은 버그가 쌓이는 문제를 겪었다. 이를테면 시간 파싱에 실패하면 예외 처리 후 DB에 삽입해 버리는 실수를 발견했다. 댓글에서는 개선책으로 유닛 테스트 도입, 온도 0.6으로 낮추기, 코드를 모듈로 분리, 모듈별 README 작성 등을 제안했다. 모델에 전체 프로젝트를 읽히지 말고 관련 코드만 넘기는 편이 효과적이라는 조언도 있었다. 원문
Opus 4.5와 Qwen3.6-27B 비교 (추천 304 · 댓글 65)
첨부 이미지를 보면 Opus 4.5와 Qwen3.6-27B를 여러 벤치마크(GPOA, SWE-Bench, Terminal-Bench)로 비교했을 때 일부 영역에서는 Opus가 우세했고 일부에서는 동등했다. 댓글에서는 Opus가 더 믿을 만하지만 Qwen은 코드 리뷰를 강제해 품질을 끌어올린다는 의견이 나왔다. 레거시 코드 환경이라면 Qwen과 Gemma가 Opus와 비슷한 코드 품질을 낸다는 경험담을 전한 사용자도 있었다. 원문
Qwen-AgentWorld-35B-A3B
에이전트 환경 시뮬레이션 모델 (추천 68 · 댓글 20)
Qwen 팀이 공개한 AgentWorld-35B-A3B는 에이전트 환경을 시뮬레이션하는 특화 모델이다. 댓글에서는 이 모델이 일상적인 추론용이 아니라 합성 데이터 생성이나 모델 훈련 환경 구축에 적합하다는 설명이 주를 이뤘다. 원문
사용자 평가: 최고의 로컬 모델? (추천 50 · 댓글 57)
한 사용자는 12GB VRAM 환경에서 Qwen-AgentWorld-35B-A3B가 최고의 로컬 모델이라고 평가했다. 댓글에서는 이 모델이 일반 용도가 아니라 에이전트 환경 시뮬레이션용이라고 짚으면서 범용 코딩에는 Qwen 3.6 27B나 35B-A3B를 추천하는 반응이 많았다. 원문
벤치마크
SWE-rebench 리더보드 업데이트: Claude Opus 4.8 xhigh 56.5% 등 신규 모델 추가 (추천 184 · 댓글 50)
SWE-rebench 리더보드에 Claude Opus 4.8 xhigh(56.5%), GLM-5.2(51.1%), Gemini 3.5 Flash(49.5%) 등 새 모델이 추가되고 UI도 손봤다. 로컬 모델 중에서는 Qwen3.6-27B가 36.5%로 크기 대비 강력한 성능을 냈고 Qwen3.6-35B-A3B와 Gemma 4 31B도 목록에 올랐다. 댓글에서는 MiniMax M2.7, Step-3.7-Flash 같은 더 작은 모델의 벤치마크를 요청하는 의견이 많았고 Ornith-1.0이나 Nex-N2 같은 최신 파인튠을 궁금해하는 사람도 있었다. 원문
출처
- GLM5.2, 300+ TPS로 깜짝 등장 — 코딩 성능 Opus 4.8급? — r/ZaiGLM, u/founders_keepers
- 예산 $2500 하드웨어에서 GLM-5.2 실행하기 — r/LocalLLaMA, u/segmond
- 컨슈머 하드웨어에서 GLM-5.2 실행 경험 — r/LocalLLaMA, u/phwlarxoc
- Claude Code를 대체할 가장 똑똑한 로컬 모델 — r/LocalLLM, u/Any-Lingonberry7411
- Qwen 3.6 27B Q8을 Claude Code Opus 4.7-4.8 대체용으로 — r/LocalLLM, u/Just-Upstairs-4338
- Qwen3.6-27B @ 210K 컨텍스트 + ~57 tok/s — RTX 3080 20GB에서 실행 — r/LocalLLM, u/Aggressive-Support15
- 토큰 속도 2배, KV 캐시 VRAM 대폭 감소 - Qwen 27B — r/LocalLLaMA, u/9r4n4y
- 코드베이스가 커지면서 Qwen3.6-27B 버그 누적 - 효율적 사용법 — r/LocalLLaMA, u/BitGreen1270
- Opus 4.5 vs Qwen3.6-27B — r/LocalLLM, u/volpestyle
- Qwen-AgentWorld-35B-A3B — r/LocalLLM, u/AdministrativeMeat3
- Qwen-AgentWorld-35B-A3B가 최고의 로컬 AI 모델인가요? — r/LocalLLM, u/Oleszykyt
- SWE-rebench 리더보드 업데이트: GLM-5.2, Qwen3.6-27B 등 — r/LocalLLaMA, u/Fabulous_Pollution10