MAI-Code-1-Flash: Mô hình code 137B của Microsoft, nhưng cộng đồng không dễ bị thuyết phục

Microsoft ra mắt MAI-Code-1-Flash — mô hình coding 137B tham số, tích hợp thẳng vào GitHub Copilot. Benchmark thắng Claude Haiku 4.5 nhưng cộng đồng HN chỉ ra điểm yếu: hiệu suất/tham số kém hơn hẳn Qwen 35B, chọn đối thủ so sánh quá yếu.

microsoftaicoding-assistantgithub-copilotmai

Ngày 2/6/2026, Microsoft chính thức giới thiệu MAI-Code-1-Flash — mô hình coding mới do đội Superintelligence của Microsoft tự xây dựng từ đầu, dùng “dữ liệu sạch, được cấp phép hợp lệ.” Mô hình đang được triển khai dần cho người dùng GitHub Copilot cá nhân trong VS Code.

Bài toán Microsoft nhắm đến rất rõ: một model coding nhanh, rẻ, hoạt động tốt trong môi trường thực tế, không phải chỉ tối ưu cho benchmark. Nhưng cộng đồng developer trên Hacker News (402 điểm, 178 bình luận) không mấy ấn tượng. Dưới đây là phân tích.

Thông số kỹ thuật & benchmark

Theo model card chính thức, MAI-Code-1-Flash là mô hình 137B tham số tổng, 5B tham số active (Mixture-of-Experts). Microsoft so sánh trực tiếp với Claude Haiku 4.5:

BenchmarkMAI-Code-1-FlashClaude Haiku 4.5
SWE-Bench Pro51.2%35.2%
SWE-Bench VerifiedThắng + dùng ít hơn 60% token
IF Bench (instruction following)+28.9 điểm
Adversarial reasoning (186 câu)85.8%

Điểm đáng chú ý: mô hình được huấn luyện trực tiếp với GitHub Copilot harness — bộ công cụ agentic thực tế mà developer dùng hàng ngày. Điều này có nghĩa là các cải tiến offline có khả năng chuyển hóa thành chất lượng thực tế cao hơn.

Microsoft nhấn mạnh tính năng “adaptive solution length” — mô hình tự điều chỉnh độ dài câu trả lời: ngắn gọn cho task đơn giản, chi tiết cho task phức tạp. Kết quả: giải được bài toán khó hơn với ít token hơn 60%.

Cộng đồng HN nói gì?

Dù 402 upvote là con số ấn tượng, phần bình luận lại khá hoài nghi. Ba luồng ý kiến chính:

1. So sánh với đối thủ yếu

“They benchmark against Claude Haiku but Haiku is not good, it’s worse than tiny open models you can run locally or via API at 10% the cost.” — camelmel

Đây là chỉ trích lớn nhất. Haiku 4.5 không phải là chuẩn mực cho coding — các mô hình open-source như Qwen đã vượt qua nó từ lâu. Việc Microsoft chọn Haiku làm đối thủ duy nhất khiến nhiều người đặt câu hỏi về sự tự tin thực sự của họ.

2. Hiệu suất trên mỗi tham số kém

“MAI-Code-1-Flash (137B-A5B) = 51% on SWE-bench Pro. Qwen3.6-35B-A3B = 49.5%. That’s a 75% smaller model.” — mdasen

Con số biết nói: Qwen3.6-35B-A3B đạt 49.5% SWE-Bench Pro với 35B tham số (3B active), trong khi MAI-Code-1-Flash cần 137B (5B active) để đạt 51.2%. Chênh lệch chỉ 1.7 điểm phần trăm nhưng mô hình Microsoft to gấp 4 lần. Với MoE, con số active parameter còn đáng quan ngại hơn: 5B vs 3B.

3. Kỳ vọng bị đặt sai chỗ

“I would hope they come out with a ‘Sonnet’ competing model, then Opus.” — giancarlostoro

Nhiều người mong Microsoft ra mắt model cạnh tranh với Claude Sonnet hoặc Opus — không phải Haiku. Một model “Flash” giá rẻ là bước đi an toàn, nhưng không tạo được đột phá trong bối cảnh thị trường đã có quá nhiều lựa chọn tầm trung.

Bối cảnh: Copilot đang chuyển sang定价 theo token

Một chi tiết quan trọng bị Microsoft bỏ qua trong thông cáo: GitHub Copilot vừa thay đổi cơ chế tính phí từ per-request sang per-token credit. Cụ thể:

GóiGiá/thángCredit AI
Free$0Có giới hạn
Pro$10$15 credits
Pro+$39$70 credits
Max$100$200 credits

Mô hình dùng ít token hơn 60% nghe có vẻ hấp dẫn — nhưng chỉ khi bạn đã trả tiền Copilot. Nếu không, MAI-Code-1-Flash không khả dụng qua API độc lập như DeepSeek hay Qwen.

Góc nhìn thực tế

Điểm tốt:

  • Tích hợp sâu với GitHub Copilot — trải nghiệm liền mạch cho người dùng VS Code
  • Adaptive thinking giúp tiết kiệm token thực sự có giá trị với các gói Copilot Pro+
  • Microsoft tự xây dựng model cho thấy họ nghiêm túc với AI coding, không chỉ phụ thuộc OpenAI

Điểm yếu:

  • Hiệu suất/tham số thua xa open-source (Qwen 35B gần bằng với 1/4 kích thước)
  • Chỉ so sánh với Haiku — không đối đầu với Sonnet, DeepSeek, hay các đối thủ thực sự
  • Bị khóa trong hệ sinh thái Copilot, không có API công khai
  • Thời điểm ra mắt trùng với đợt tăng giá Copilot — timing không tốt

Bottom line

MAI-Code-1-Flash là bước đi hợp lý cho Microsoft: một model coding “đủ dùng” cho Copilot, tích hợp chặt với hệ sinh thái, giảm phụ thuộc vào OpenAI. Nhưng với developer có kinh nghiệm — những người đã dùng Claude Code, Cursor, hoặc tự host Qwen/DeepSeek — đây chưa phải là lý do để quay lại Copilot.

Microsoft cần một model tầm “Sonnet” hoặc “Opus” để thực sự cạnh tranh. MAI-Code-1-Flash chỉ là màn dạo đầu.


Nguồn: Microsoft AI Blog, MAI-Code-1-Flash Model Card, HN Discussion, Qwen3.6-35B-A3B, GitHub Copilot Pricing.