GPT-5.6 chính thức mở cửa: Sol, Terra, Luna — model nào đáng tiền nhất?
OpenAI chính thức mở GPT-5.6 cho toàn bộ người dùng ChatGPT, Codex và API. Ba model Sol/Terra/Luna với giá từ $1-$30/1M token. So sánh benchmark thực tế với GPT-5.5 và Claude Fable 5, kèm phân tích hiệu năng trên từng đồng tiền.
Hôm nay (9/7), OpenAI chính thức mở GPT-5.6 cho toàn bộ người dùng — không còn giới hạn “trusted partners” như bản preview tháng trước. Đây là lần đầu tiên OpenAI ra mắt cùng lúc ba model trong cùng một thế hệ, mỗi model nhắm đến một phân khúc giá/hiệu năng rõ ràng. Bài này phân tích benchmark, giá, và quan trọng nhất: model nào đáng dùng cho việc gì.
Ba model, ba mức giá
| Model | Input (1M token) | Output (1M token) | Định vị |
|---|---|---|---|
| Sol | $5 | $30 | Flagship — mạnh nhất |
| Terra | $2.50 | $15 | Cân bằng — thay thế GPT-5.5 |
| Luna | $1 | $6 | Siêu rẻ — vẫn mạnh hơn Opus 4.8 |
Để so sánh: GPT-5.5 có giá $5/$30 — y hệt Sol. Nhưng Sol mạnh hơn đáng kể. Còn Claude Fable 5 của Anthropic: $10/$50. Đắt gấp đôi Sol và gấp 8 lần Luna.
Takeaway đầu tiên: Nếu bạn đang dùng GPT-5.5 qua API, chuyển sang Terra là nâng cấp miễn phí (tốt hơn, rẻ hơn 50%). Nếu cần mạnh nhất, Sol cùng giá GPT-5.5 nhưng benchmark cao hơn hẳn.
Performance-per-dollar: Luna là ngôi sao
Điểm đáng chú ý nhất không phải Sol — mà là Luna, model rẻ nhất. Trên Artificial Analysis Intelligence Index (đánh giá tổng hợp về coding, agent, scientific reasoning), Luna đạt 51.2 điểm — ngang với Claude Opus 4.8 (55.7) nhưng rẻ hơn ~10 lần.
Trên coding cụ thể: Artificial Analysis Coding Agent Index chấm Luna 74.6 điểm — vượt Opus 4.8 (72.5). Cùng lúc, Luna dùng ít token hơn, nhanh hơn, và rẻ hơn 4 lần.
Coding Agent Index:
Sol 80.0 ← SOTA, đánh bại Fable 5 (77.2)
Terra 77.4 ← Ngang Fable 5, rẻ hơn 4x
Luna 74.6 ← Vượt Opus 4.8, rẻ hơn ~10x
Fable 5 77.2 ← $10/$50
Opus 4.8 72.5 ← $15/$75
Ultra mode: Chạy 4 agent song song
Tính năng mới đáng giá nhất của GPT-5.6 là Ultra — tự động chạy 4 sub-agent song song để giải quyết tác vụ phức tạp. Kết quả benchmark cho thấy Ultra đẩy điểm số lên đáng kể:
- Terminal-Bench 2.1: Sol thường 88.8% → Ultra 91.9%
- BrowseComp: Sol thường 90.4% → Ultra 92.2%
- SEC-Bench Pro: Sol thường 71.2% → Ultra 74.3%
Điều thú vị: Ultra không chỉ tăng điểm — nó còn giảm latency vì xử lý song song. Trên biểu đồ latency-score của OpenAI, đường Ultra dịch lên-trên-và-sang-trái so với single-agent baseline.
Để so sánh: Anthropic không có tính năng tương đương public. Claude Code chạy sub-agent nội bộ nhưng không expose qua API.
Programmatic Tool Calling: Model tự viết code để xử lý tool
Một innovation quan trọng cho developer: GPT-5.6 có thể tự viết và chạy chương trình nhỏ trong lúc gọi tool. Thay vì gửi toàn bộ output của tool về model, model tự filter, aggregate, và ra quyết định — tiết kiệm token và round-trip.
Cụ thể: Trước đây, gọi 5 tool = 5 request API. Với Programmatic Tool Calling, model tự xử lý intermediate results, chỉ gửi kết quả cuối về. Điều này đặc biệt có giá trị với tác vụ cần duyệt nhiều trang web, query database nhiều lần, hoặc xử lý file lớn.
Lưu ý: Tính năng này tương thích với Zero Data Retention (ZDR) — quan trọng cho enterprise.
Bảo mật: Chặn gấp 10 lần, nhưng có friction
OpenAI nói thẳng trong System Card: GPT-5.6 Sol chặn gấp 10 lần hoạt động độc hại so với model cũ. Hệ thống layered — vừa có activation classifier can thiệp real-time, vừa có reasoning monitor đánh giá context toàn bộ hội thoại.
Trade-off: Người dùng hợp pháp sẽ gặp nhiều false positive hơn. OpenAI cung cấp nút “retry with lower-capability model” để giảm friction, nhưng thừa nhận đây là cách tiếp cận “bảo thủ” ban đầu.
Về cybersecurity capability: GPT-5.6 đạt High (không phải Critical). Nó mạnh hơn hẳn trong defensive tasks (tìm và vá lỗ hổng) so với offensive (tự động tấn công end-to-end). OpenAI lập luận rằng mở rộng truy cập cho defender là net positive cho an ninh mạng.
Dùng model nào cho việc gì?
Dựa trên benchmark và giá, khuyến nghị thực tế:
| Nhu cầu | Model | Lý do |
|---|---|---|
| Coding agent, codebase lớn | Sol + Ultra | Coding Agent Index 80, Terminal-Bench 91.9% |
| Thay thế GPT-5.5 hằng ngày | Terra | Ngang Fable 5, rẻ hơn 4x |
| Tác vụ nhẹ, volume cao | Luna | Mạnh hơn Opus 4.8, $1/$6 |
| Nghiên cứu khoa học | Sol | GeneBench Pro 28.7% vs GPT-5.5 12% |
| Computer use, browsing | Sol + Ultra | BrowseComp 92.2%, OSWorld 62.6% |
Vài con số đáng chú ý khác
- Agents’ Last Exam (bài thi agent chuyên nghiệp 55 lĩnh vực): Sol đạt 53.6 — hơn Fable 5 tới 13.1 điểm. Terra và Luna cũng vượt Fable 5 dù rẻ hơn ~16 lần.
- Cybersecurity: ExploitBench tăng từ 47.9% (GPT-5.5) lên 73.5% (Sol). Nhưng vẫn chưa đạt Critical threshold.
- Self-improvement (RSI): Sol tăng 16.2 điểm so với GPT-5.5. OpenAI dùng GPT-5.6 nội bộ để debug, tối ưu kernel, và cải thiện model khác — token usage của researcher tăng gấp đôi so với thời GPT-5.5.
- Prompt caching cải tiến: Explicit cache breakpoint, TTL tối thiểu 30 phút, cache write = 1.25x input thường, cache read = 90% discount.
Truy cập ở đâu?
- ChatGPT: Plus/Pro/Business/Enterprise dùng Sol. Free dùng Terra qua ChatGPT Work.
- Codex: Plus trở lên dùng Sol + Ultra. Free dùng Terra.
- API: Cả ba model đều có. Responses API hỗ trợ Programmatic Tool Calling và multi-agent beta.
- Rollout: Đang triển khai dần, sẽ hoàn tất trong 24h tới.
Tóm lại: GPT-5.6 là bản nâng cấp hiếm hoi mà bạn được nhiều hơn với cùng số tiền. Sol mạnh hơn GPT-5.5 cùng giá. Terra rẻ hơn GPT-5.5 mà vẫn mạnh hơn. Luna là model giá rẻ đầu tiên thực sự cạnh tranh được với flagship của đối thủ. Nếu bạn đang trả tiền cho GPT-5.5 hoặc Claude Opus 4.8, đây là lúc chuyển đổi.
Nguồn: OpenAI GPT-5.6 announcement, System Card, OpenAI Pricing, Anthropic Pricing. Giá truy cập 09/07/2026.