323 lập trình viên HN tranh luận: LLM local có thay được Claude/GPT để code hàng ngày không?

Phân tích từ cuộc tranh luận 646 điểm trên Hacker News: mô hình nào chạy local thực sự code được, phần cứng cần bao nhiêu RAM, và vì sao nhiều người đã bỏ hẳn API cloud. Kèm trải nghiệm thật từ lập trình viên.

local-llmai-codingqwenllama-cppprivacy

Sáng nay một câu hỏi đơn giản trên Hacker News đã thu hút 646 điểm và 324 bình luận chỉ trong vài giờ: “Có ai đã thay thế hoàn toàn Claude/GPT bằng mô hình local để code hàng ngày chưa?”

Câu trả lời ngắn: Có. Nhiều người đã làm được. Nhưng không phải ai cũng nên làm.

Ba trường phái nổi lên từ 324 bình luận

1. Người đã “cai” hoàn toàn cloud API

Nhóm này chạy mô hình local làm công cụ code chính. Họ không còn trả tiền cho Claude/GPT/Cursor.

Greenpants (Mac Studio 128GB RAM + MacBook 36GB RAM) dùng Qwen3.6 35B qua Pi coding harness, containerized hoàn toàn offline:

“Nếu Opus cho tốc độ gấp 15 lần, thì Qwen local cho tốc độ gấp 5 lần. Với một thứ hoàn toàn miễn phí, con số đó vẫn khiến tôi kinh ngạc.”

Cậu ấy đã thiết kế lại toàn bộ website và blog bằng Django + Wagtail — một framework ít phổ biến — hoàn toàn với Qwen local, không internet.

Một lập trình viên khác dùng Step 3.7 Flash ở quantization IQ4_XS trên hộp GB10 Asus nhận thấy nó hoàn thành task nhanh hơn Qwen3.6 27B dù token/s thấp hơn — vì ít mắc lỗi, ít phải sửa đi sửa lại.

2. Người dùng hybrid: local cho việc nhỏ, cloud cho việc khó

Đây là nhóm đông nhất. Pattern phổ biến:

  • Việc lặt vặt (đổi tên biến, viết test, refactor nhỏ) → local model
  • Kiến trúc / thiết kế hệ thống → Claude Opus hoặc GPT-5.5
  • Code review ban đầu → local model (tiết kiệm token)
  • Review cuối cùng trước merge → cloud model (độ tin cậy cao)

Một lập trình viên tóm gọn:

“So sánh Qwen3.6 35B agentic với Claude Opus giống như junior biết mọi thứ bạn phải dắt tay, với senior biết suy nghĩ cùng bạn về kiến trúc.”

3. Người không chạy local vì lý do kinh tế

Một góc nhìn đáng chú ý từ throwaway202606:

“Tôi có thể dùng Gemini 3 Flash với harness tự build trong 8 năm mà vẫn chưa hết tiền mua một cái Mac Studio 128GB. Cái giá cho privacy rất cao.”

Thực tế: Mac Studio M4 Ultra 128GB RAM có giá khoảng $5,599. Với $20/tháng cho Claude Pro, bạn dùng được 23 năm. Với API pay-as-you-go, còn lâu hơn nếu dùng model rẻ như Gemini Flash hoặc DeepSeek.

Local LLM có lý về privacy, không hẳn về tiền.

Mô hình nào đang được dùng thực tế?

Từ 324 bình luận, đây là các model được nhắc đến nhiều nhất:

ModelKích thướcActive paramsPhần cứng tối thiểu
Qwen3.6 35B (MoE)35B tổng~3B active32-48GB RAM
Qwen3.5 122B (MoE)122B tổng~10B active96-128GB RAM
Qwen3.6 27B27B27B24-32GB RAM
Step 3.7 Flash~30B30B24-32GB RAM
DeepSeek Coder V216B-236B (MoE)2.4B-21B16-64GB RAM

Mô hình MoE (Mixture of Experts) như Qwen3.5/3.6 và DeepSeek là lựa chọn phổ biến nhất cho local coding vì chỉ kích hoạt một phần nhỏ tham số, giúp chạy nhanh trên phần cứng tiêu dùng.

Một phát hiện thú vị: Qwen3.6 35B (3B active) nhanh hơn và ổn định hơn Qwen3.6 27B (27B active) trên nhiều tác vụ coding, dù tổng tham số lớn hơn.

Phần cứng: Bạn cần gì?

Dựa trên trải nghiệm thực tế từ các bình luận:

MacBook M1 Pro 16GB: Chạy được model 7-9B ở quant 4-bit. Tốc độ ~15-25 tok/s. Đủ cho autocomplete và câu hỏi đơn giản.

MacBook Pro/Max 36-48GB: Chạy Qwen3.6 35B (MoE, 3B active) ở quant 4-5 bit. Tốc độ ~30-50 tok/s. Đủ cho coding agent đơn giản.

Mac Studio / Strix Halo 128GB: Chạy Qwen3.5 122B (10B active) hoặc model 70B thông thường. Tốc độ ~20-35 tok/s. Đủ thay thế hoàn toàn cloud API cho hầu hết tác vụ.

Máy cũ / RAM thấp: Không nên cố. Dùng API rẻ hơn và nhanh hơn nhiều.

Một lập trình viên thậm chí chạy Qwen3.5 9B trên dual Xeon 10 năm tuổi với 256GB DDR4 — tốc độ chỉ 2-4 tok/s nhưng vẫn hoàn thành được task đơn giản như convert video.

Cạm bẫy khi code với local LLM

Qua 324 bình luận, đây là những vấn đề lặp đi lặp lại nhiều nhất:

1. Edit tool hay bị sai

Đây là vấn đề số 1. Local model thường xuyên gọi sai tham số edit tool, dẫn đến loop sửa đi sửa lại. Một số giải pháp:

  • Dùng quantization cao hơn (Q6-Q8 thay vì Q4) — giảm lỗi edit tool đáng kể
  • Dùng hash-based editing thay vì search-and-replace
  • Cập nhật system prompt để model không cố sửa file quá lớn

2. Không giữ được context qua nhiều lượt

Vấn đề phổ biến với Qwen hybrid models trên llama.cpp: prompt cache không hoạt động, model phải re-process toàn bộ context mỗi lượt.

Fix: Dùng Vulkan backend thay vì ROCm (nhanh hơn và ổn định hơn với Qwen), hoặc bật preserve_thinking.

3. Cần prompt cực kỳ chính xác

Không như Claude có thể “đoán ý” bạn, local model cần hướng dẫn rõ ràng từng bước. Một lập trình viên nhận xét:

“Bạn phải biết chính xác mình muốn gì. Mọi giả định bỏ ngỏ sẽ khiến nó chọn con đường dễ nhất — thường là CSS inline trong HTML thay vì kiến trúc đúng.”

AIFirst Take: Khi nào thì đáng để chuyển?

Chuyển ngay nếu:

  • Bạn code cho tổ chức EU / healthcare / tài chính — nơi compliance chưa rõ ràng về AI
  • Bạn đã có sẵn máy 48GB+ RAM
  • Bạn code offline thường xuyên
  • Bạn làm việc với codebase private không muốn gửi lên cloud

Đừng chuyển (hoặc dùng hybrid) nếu:

  • Bạn cần tốc độ phát triển tối đa
  • Bạn làm kiến trúc hệ thống phức tạp
  • Bạn chỉ có laptop 16GB RAM thông thường
  • Bạn là người mới học code (cần model “nghĩ hộ”)

AIFirst khuyến nghị: Với giá API đang giảm từng ngày (DeepSeek V4 Pro ~$0.27/1M token input), hybrid là chiến lược tối ưu cho hầu hết lập trình viên Việt Nam hiện nay. Dùng local model cho 80% việc lặt vặt, gọi cloud API cho 20% việc khó.


Nguồn: Ask HN: Has anyone replaced Claude/GPT with a local model for daily coding? — 646 points, 324 comments (June 16, 2026)