Inkling: Cựu CTO OpenAI ra mắt model open-weight 975B tham số — mạnh nhất nước Mỹ nhưng vẫn thua Trung Quốc
Mira Murati, cựu CTO OpenAI, vừa phát hành Inkling — model MoE 975B tham số (41B active), multimodal gốc, hỗ trợ 1M token context. Dẫn đầu open-weight Mỹ nhưng hallucination 63%, đắt hơn model Trung Quốc. Phân tích benchmark, giá và positioning.
Ngày 15/7/2026, Thinking Machines Lab — startup do Mira Murati (cựu CTO OpenAI, người đóng vai trò then chốt trong việc phát triển ChatGPT) thành lập — chính thức phát hành model open-weight đầu tiên: Inkling.
Đây là một trong những model open-weight quy mô lớn nhất từng được một công ty Mỹ phát hành. Nhưng đừng vội phấn khích — bài viết này phân tích thực tế con số, không PR.
Inkling là gì?
| Thông số | Chi tiết |
|---|---|
| Kiến trúc | Mixture-of-Experts (MoE) Transformer |
| Tổng tham số | 975B |
| Tham số active | 41B |
| Context window | Lên đến 1M token |
| Dữ liệu huấn luyện | 45 nghìn tỷ token (text, ảnh, audio, video) |
| Multimodal | Text + ảnh + audio (native, không wrapper) |
| Giấy phép | Open weights (tải trên Hugging Face) |
| Ngày phát hành | 15/07/2026 |
Ngoài ra, họ còn preview Inkling-Small: 276B tổng / 12B active — nhẹ hơn nhiều nhưng đạt điểm GPQA Diamond 88.3% (cao hơn cả bản lớn 87.2%).
Benchmark: Dẫn đầu open-weight Mỹ, nhưng…
Theo Artificial Analysis, Inkling đạt 41 điểm trên Intelligence Index — cao nhất trong tất cả model open-weight của Mỹ:
- Inkling: 41
- Nemotron 3 Ultra: 38
- Gemma 4 31B: 29
- GPT-OSS 120B: 24
Trên GDPval-AA v2 (benchmark agentic mô phỏng tác vụ tri thức), Inkling đạt Elo 1,238 — vượt Kimi K2.6 (1,190) và DeepSeek v4 Flash max (1,189).
✅ Điểm mạnh:
- Agentic task & tool use: vượt trội so với mọi open-weight model khác
- Token efficiency: dùng ít token hơn 30-60% để đạt cùng điểm số (ví dụ: match Nemotron 3 Ultra trên Terminal Bench 2.1 chỉ với ~1/3 token)
- Controllable thinking effort: lập trình viên có thể điều chỉnh effort từ 0.2 → 0.99 để cân bằng chi phí/hiệu năng
- Multimodal native: xử lý text, ảnh, audio trong cùng một model — không cần ghép nối
❌ Điểm yếu:
- Hallucination rate: 63% — đây là con số đáng báo động. Accuracy chỉ 40% trên AA Omniscience
- Tổng thể vẫn thua model Trung Quốc (Kimi K3, GLM-5.2) trên hầu hết benchmark text & code
- Giá cao hơn model Trung Quốc (xem bên dưới)
Họ thẳng thắn thừa nhận: “Inkling is not the strongest overall model available today, open or closed.”
Giá cả: không rẻ
| Context | Input | Output | Cached input |
|---|---|---|---|
| ≤ 64K | $1.87/1M token | $4.68/1M token | — |
| ≤ 256K | $3.74/1M token | $9.36/1M token | $0.748/1M token |
So sánh nhanh với một số model open-weight khác (giá input ≤ 64K):
- GLM-5.2: ~$0.50-1.00/1M token
- DeepSeek v4: ~$0.50-1.50/1M token
- Inkling: $1.87/1M token
Đắt gấp 2-3 lần model Trung Quốc tương đương. Bù lại, Inkling dùng ít token output hơn — trung bình 25K token/task, trong khi GLM-5.2 max dùng 43K và Kimi K2.6 dùng 38K.
Chiến lược: Fine-tuning, không phải general-purpose
Điểm khác biệt lớn nhất của Thinking Machines so với OpenAI hay Anthropic: họ không cố gắng bán model mạnh nhất. Họ bán nền tảng fine-tuning.
Inkling được thiết kế làm base model để tùy chỉnh — kết hợp với Tinker, nền tảng fine-tuning của họ. Ý tưởng: mỗi doanh nghiệp có nhu cầu khác nhau, không model nào “one-size-fits-all”.
Minh chứng thú vị: họ để Inkling tự fine-tune chính nó. Model viết job fine-tuning, chạy, rồi tự đánh giá kết quả. Demo này chạy trong OpenCode harness và cho thấy quy trình customization khép kín.
Góc nhìn: Tại sao chuyện này quan trọng?
1. Mỹ cuối cùng cũng có open-weight frontier model nghiêm túc
Trước Inkling, top open-weight toàn là Trung Quốc: DeepSeek, Kimi, GLM. Nemotron 3 Ultra là model Mỹ duy nhất tiệm cận nhưng vẫn thua xa. Inkling là bước đi đầu tiên để cân bằng lại.
2. “Open” không có nghĩa là “miễn phí”
Weights có sẵn, nhưng tự host 975B tham số (dù chỉ 41B active) không hề rẻ. Với giá inference $1.87/1M input, chạy qua API của họ cũng không rẻ hơn tự host là bao. Open weights ở quy mô này chủ yếu có ý nghĩa với research lab và enterprise có hạ tầng GPU riêng.
3. 63% hallucination là vấn đề thực sự
Với tỉ lệ ảo giác 63%, Inkling không phù hợp cho các ứng dụng cần độ chính xác cao: tài chính, y tế, pháp lý. Đây là lý do họ định vị nó là base model — bạn cần fine-tune trên dữ liệu của riêng mình để giảm hallucination.
4. Mira Murati và triết lý “AI không tập trung”
Murati rời OpenAI giữa lúc công ty này đang đóng model ngày càng chặt (GPT-5.6 không có weights, chỉ API). Việc bà chọn phát hành open-weight cho thấy một hướng đi khác: minh bạch hơn, cho phép cộng đồng kiểm tra và tùy chỉnh.
Dành cho developer Việt Nam: Có nên dùng không?
✅ Nên thử nếu bạn:
- Cần một base model multimodal (text + ảnh + audio) để fine-tune cho domain riêng
- Làm agentic task — đây là thế mạnh số một của Inkling
- Muốn nghiên cứu / experiment với model Mỹ mới nhất
❌ Chưa nên nếu bạn:
- Cần accuracy cao cho production (hallucination 63% là rào cản lớn)
- Budget hạn chế — DeepSeek v4 hoặc GLM-5.2 rẻ hơn 2-3 lần
- Chỉ cần text/code — model Trung Quốc vẫn mạnh hơn
Tóm lại
Inkling là một cột mốc quan trọng: Mỹ đã có open-weight frontier model nghiêm túc đầu tiên. Nhưng nó chưa phải “GPT-killer” — hallucination cao, giá đắt, và vẫn thua model Trung Quốc về hiệu năng thuần. Vị thế thực sự của nó là base model cho fine-tuning, không phải general-purpose chatbot.
Dù sao, việc cựu CTO OpenAI chọn open-weight thay vì đóng model là một tín hiệu đáng chú ý cho hướng đi của ngành.
Nguồn: Thinking Machines Lab (thinkingmachines.ai), The Decoder, Artificial Analysis, Hugging Face. Giá truy cập 16/07/2026.