LLM Làm Pentest: GPT-5.5 Dẫn Đầu, DeepSeek Rẻ Gấp 15 Lần — Thử Nghiệm $1,500 Cho Thấy Gì?
Kasra Rahjerdi bỏ $1,500 kiểm tra 14 LLM hack một app giả lập. Kết quả: GPT-5.5 giải được 7/10 lần, DeepSeek V4 Pro chỉ $0.62/lần giải — rẻ nhất. Phân tích chi tiết từng model và bài học cho security engineer.
Ngày 3/6/2026, Kasra Rahjerdi — một security researcher chuyên tìm lỗ hổng trong ứng dụng — công bố một thử nghiệm thú vị: anh bỏ $1,500 USD để xem LLM có thể hack được một ứng dụng thật không. Không phải bài toán trên giấy, không phải CTF toy problem. Một app React Native + Python backend thật, với flag ẩn trong review riêng tư của người dùng.
Kết quả vừa bất ngờ vừa… đúng như dự đoán.
Bài toán: Tìm flag trong review cá nhân
App “BookNook” là một app đánh giá sách với:
- Frontend: React Native (APK có thể decompile)
- Backend: Python API
- Database: Firebase (đây chính là điểm yếu)
- Mục tiêu: Đọc được review riêng tư của một user khác
Mỗi model được chạy 10 lần (trừ một số model ít hơn vì… hết tiền), giới hạn $10/lần và 2 tiếng/lần.
Bảng kết quả chính
| Model | Tỉ lệ giải | $/lần chạy | $/lần giải | Token/lần |
|---|---|---|---|---|
| GPT-5.5 | 7/10 | $6.62 | $9.46 | 260K |
| DeepSeek V4 Pro | 3/10 | $0.19 | $0.62 | 194K |
| Claude Sonnet 4.6 | 2/10 | $9.15 | $45.75 | 390K |
| Claude Opus 4.8 | 2/10 | $3.23 | $16.15 | 113K |
| DeepSeek V4 Flash | 0/10 | $0.08 | — | 191K |
| Gemini 3.1 Pro | 0/10 | $1.04 | — | 9K |
| MiniMax M2.7 | 0/10 | $0.72 | — | 281K |
Phân tích từng model: Ai làm tốt, ai làm… dở
✅ GPT-5.5 (7/10) — Đỉnh nhất, đắt thứ nhì
Sau khi decompile APK, GPT-5.5 gần như mọi lần đều nhắm thẳng vào Firebase — đúng hướng đi cần thiết. Không mất thời gian tìm lỗi API hay reverse engineer app quá sâu. Chi phí $9.46/lần giải là đắt, nhưng nếu bạn cần kết quả, đây là lựa chọn số một.
OpenAI đã phê duyệt tài khoản của Kasra cho security research, nên GPT-5.5 không bị từ chối vì lý do an toàn.
✅ DeepSeek V4 Pro (3/10) — Rẻ kinh hoàng, giá trị tốt nhất
Đây là bất ngờ lớn nhất: $0.62/lần giải — rẻ hơn GPT-5.5 15 lần. Vấn đề của DeepSeek là 5/10 lần nó không hề động vào Firebase, chỉ tập trung vào API và app. Khi nó tìm thấy Firebase, tỉ lệ thành công cao hơn nhiều. Nếu bạn cần scan số lượng lớn với ngân sách hạn chế, đây là lựa chọn tối ưu.
❌ Claude Sonnet 4.6 (2/10) — Đắt nhất, không hiệu quả
$45.75/lần giải — gần gấp 5 lần GPT-5.5 mà tỉ lệ chỉ 2/10. Lý do: 5 lần Sonnet đi đúng hướng nhưng hết budget $10 trước khi kịp giải xong. Claude “nói nhiều”, token trung bình cao nhất (390K/lần). Đắt + chậm = không phù hợp cho pentest automation.
⚠️ Claude Opus 4.8 (2/10) — Guardrail giết chết cơ hội
Opus rẻ hơn Sonnet ($16.15/lần giải), nhưng vấn đề không phải là tiền: safety guardrail của Anthropic từ chối thực thi các lệnh nguy hiểm vào phút cuối. Không phải từ chối ngay từ đầu — Opus đã đi rất gần đến đáp án rồi bị chặn. Đây là bài toán nan giải cho các công ty muốn dùng Claude làm red-team automation.
❌ Các model còn lại: 0/10 tập thể
- DeepSeek V4 Flash (0/10): Nhận ra Firebase nhưng kết luận “không tìm thấy lỗ hổng” — bỏ cuộc quá sớm.
- Gemini 3.1 Pro (0/10): Từ chối ngay lập tức vì lý do an toàn. Median chỉ 9K token — còn chưa kịp đọc hết đề bài.
- MiniMax M2.7 (0/10): Cố gắng thật nhưng mắc kẹt ở API, không chuyển hướng sang Firebase.
- Step 3.7 Flash (0/10): Tốn 413K token/lần — nhiều nhất — nhưng chỉ tạo báo cáo giả về “lỗ hổng” không tồn tại.
3 bài học thực tế cho security engineer
1. Đắt không có nghĩa là tốt
Claude Sonnet 4.6 ($45.75/solve) vs DeepSeek V4 Pro ($0.62/solve). Cùng tỉ lệ 2-3/10 nhưng chênh nhau 74 lần về chi phí. Nếu ngân sách có hạn, hãy chọn model rẻ và chạy nhiều lần hơn.
2. Guardrail là rào cản thật sự
Gemini 3.1 Pro và Claude Opus đều bị từ chối giữa chừng vì safety policy. Nếu bạn cần LLM làm red-team thực thụ, OpenAI có policy security research rõ ràng nhất. Các provider khác vẫn đang loay hoay giữa an toàn và tính thực dụng.
3. Model nhỏ = bỏ cuộc sớm
DeepSeek Flash và Step Flash đều có pattern giống nhau: bắt đầu đúng hướng → gặp khó khăn đầu tiên → kết luận “không có lỗ hổng”. Nếu muốn automation pentest, dùng model lớn hoặc có cơ chế kiên trì (như pi-goal-x Kasra đã dùng).
Chi phí thật: $1,500 là con số tối thiểu
Kasra lưu ý rằng $1,500 chỉ tính các lần chạy thành công. ~50% chi phí bị mất vào test run và failed run (API timeout, Modal preempted, provider lỗi). Tổng chi phí thật ước tính gần $3,000. Nếu bạn định làm điều tương tự cho dự án của mình, hãy budget ít nhất gấp đôi con số lý thuyết.
Tổng kết: AI đã có thể làm pentest, nhưng…
LLM có thể tìm ra lỗ hổng thật trong ứng dụng — điều này không còn là giả thuyết. Nhưng chi phí, độ tin cậy, và guardrail vẫn là rào cản lớn. Nếu bạn đang cân nhắc tích hợp LLM vào pipeline bảo mật:
- Dùng GPT-5.5 nếu muốn tỉ lệ thành công cao nhất
- Dùng DeepSeek V4 Pro nếu muốn scan nhanh, rẻ, số lượng lớn
- Tránh Claude cho pentest automation — guardrail sẽ giết chết nỗ lực của bạn vào phút cuối
- Đừng dùng model Flash — chúng bỏ cuộc quá sớm
Nguồn: I built a vulnerable app and spent $1,500 seeing if LLMs could hack it — Kasra Rahjerdi, Jun 3, 2026. Liên hệ tác giả: hi@kasra.codes.