Moebius: Mô hình inpainting 0.2B đánh bại FLUX 11.9B — nhỏ hơn 50 lần, nhanh hơn 15 lần

Moebius chỉ 226M tham số nhưng chất lượng inpainting ngang hoặc vượt FLUX.1-Fill-Dev (11.9B). Phân tích kiến trúc LλMI, chiến lược distillation và ý nghĩa với AI trên thiết bị biên.

computer-visionaiimage-inpaintingmodel-compressionlocal-ai

Ngày 17/6/2026, nhóm nghiên cứu từ Đại học Khoa học & Công nghệ Huazhong (HUST) công bố Moebius — một framework inpainting chỉ 0.22B tham số nhưng đạt chất lượng ngang — thậm chí vượt — FLUX.1-Fill-Dev (11.9B), mô hình inpainting mạnh nhất hiện nay.

Đây không phải một bài báo “hứa hẹn” thông thường. Moebius có code công khai, benchmark trên 6 bộ dữ liệu chuẩn, và con số thực sự gây sốc.

Con số biết nói

Chỉ sốMoebiusFLUX.1-Fill-Dev
Tham số226M (0.22B)11.9B
% kích thước< 2%100%
Tốc độ inference26ms/bướcchậm hơn 15×
Chất lượng (Places2)Ngang / vượtBaseline
Chất lượng (CelebA-HQ, FFHQ)Ngang / vượtBaseline

Làm sao 0.2B đánh bại 12B?

Bí quyết nằm ở hai đột phá:

1. Kiến trúc LλMI Block

Thay vì self-attention truyền thống (tốn O(n²)), Moebius dùng Local-λ Mix Interaction — nén toàn bộ spatial context và global semantic priors vào ma trận tuyến tính kích thước cố định. Nói đơn giản: thay vì để mỗi pixel “nói chuyện” với mọi pixel khác, Moebius tổng hợp thông tin thành một biểu diễn gọn rồi mới xử lý. Kết quả: cắt gọn 98% tham số nhưng vẫn giữ được khả năng hiểu ngữ cảnh toàn cục.

2. Adaptive Multi-Granularity Distillation

Moebius không tự học từ đầu. Nó được “dạy” bởi PixelHacker — một mô hình inpainting mạnh khác của cùng nhóm — thông qua chiến lược distillation đa cấp. Thay vì bắt student bắt chước từng pixel (tốn kém và nhiễu), quá trình distillation diễn ra hoàn toàn trong latent space, dùng nhiều gradient-based loss để căn chỉnh ở nhiều mức độ chi tiết khác nhau.

Sự kết hợp giữa kiến trúc siêu gọn và chiến lược distillation thông minh tạo ra “điểm ngọt” (synergy frontier): mô hình nhỏ nhất có thể hấp thụ được lượng kiến thức tối đa từ mô hình thầy.

Tại sao điều này quan trọng?

AI inpainting chạy trên laptop thường, thậm chí điện thoại. Với 226M tham số và 26ms/bước, Moebius có thể chạy real-time trên GPU consumer như RTX 3060, thậm chí on-device trên smartphone flagship.

Xóa vật thể trong ảnh không cần gửi lên cloud. Các ứng dụng như xóa người lạ khỏi ảnh du lịch, xóa logo khỏi ảnh sản phẩm, hay chỉnh sửa ảnh chân dung — tất cả có thể chạy hoàn toàn local, không lo privacy.

Mở ra hướng đi mới cho “specialist over generalist”. Thay vì nhồi nhét mọi thứ vào một mô hình khổng lồ, Moebius chứng minh rằng một specialist được tối ưu cho đúng 1 task có thể đánh bại generalist to gấp 50 lần.

Giới hạn: Moebius chỉ làm inpainting. Nó không sinh ảnh từ text, không làm outpainting, không edit ảnh đa năng như FLUX. Nhưng đối với đúng bài toán inpainting, nó là vô địch về hiệu năng trên mỗi tham số.

Dùng thử Moebius

Code đã có trên GitHub tại github.com/hustvl/Moebius. Paper trên arXiv: 2606.19195. Để chạy:

git clone https://github.com/hustvl/Moebius.git
cd Moebius
pip install -r requirements.txt
# Tải model weights (hướng dẫn trong repo)
python demo.py --input anh_goc.jpg --mask vung_can_xoa.png --output ket_qua.jpg

Với 226M tham số, model chỉ nặng ~500MB — tải về trong vài phút, chạy được trên GPU 6GB VRAM.

Bài học cho team Việt Nam

Moebius là minh chứng rằng bài toán tối ưu không phải lúc nào cũng là “to hơn”. Với một kiến trúc thông minh và chiến lược huấn luyện tốt, một nhóm nghiên cứu đại học hoàn toàn có thể tạo ra mô hình cạnh tranh với sản phẩm của công ty tỷ đô.

Đây cũng là hướng đi thực tế cho các startup AI Việt Nam: thay vì cạnh tranh làm foundation model (tốn trăm triệu USD), hãy làm task-specific specialist — mô hình siêu nhẹ, siêu nhanh, giải quyết đúng một bài toán cụ thể mà thị trường cần.


Nguồn: