Thariq bên Claude Code vừa trả lời câu hay bị hỏi: effort là gì, khi nào đổi, và tại sao không để max cho mọi thứ.
Câu trả lời ngắn: effort không làm model thông minh hơn. Nó nói cho model biết anh muốn nó bỏ bao nhiêu compute vào phán đoán riêng và kiểm chứng. Đổi mức giữa cuộc hội thoại không phá prompt cache. Bản tương tác nằm ở claude.dev. Ảnh dưới lấy từ bài trên X.

Một giờ hay mười hai giờ
Giao việc trong một giờ, người ta làm bản đủ dùng rồi chờ sửa. Giao mười hai giờ, họ tự đào edge case. Claude cũng vậy. Nó luôn cố làm cho ra việc. Effort cao chỉ thêm hành động độc lập: tự review, tự viết test đối kháng, tự nghi cách mình vừa chọn.
Trên Terminal-Bench 3.0, mỗi nấc effort của Opus 5.5 và Fable 5.1 đều kéo điểm lên, và cũng kéo token lên. Có chỗ cùng điểm mà token chỉ bằng một nửa.

Spec càng chặt, các mức effort càng ra kết quả giống nhau. Task mơ hồ thì max tự quyết thay anh.
App fitness không spec: low là log và một biểu đồ, max có heat chart. Low khoảng một phút rưỡi. Max khoảng 67 phút.

Redesign menu đã có hướng: mọi mức đều nghĩ tới submenu và search. Low một phút ra sketch. Max 28 phút ra mock sát Claude Code, kèm walkthrough. Muốn ở trong vòng lặp thì low nhanh hơn. Muốn one-shot đẹp thì max.

Đưa spec chi tiết rồi mới bảo implement, các mức trông giống nhau hơn. Max chủ yếu dành thời gian đơn giản hóa vài chi tiết.

Effort vá lỗ, không vá hướng sai
Trên Terminal Bench 3, tăng effort giảm lỗi thiếu edge case. Nó không cứu approach sai.
HTML sanitizer là ví dụ sạch. Low viết filter một lần, test một trang tự viết, xong trong khoảng hai phút. High đọc source parser, chạy suite XSS, rồi viết fuzzer, mất khoảng nửa giờ. Với sanitizer, số token đó đáng. Với brainstorm thì không.
Lưới dưới đây: mỗi ô là một lần thử. Tăng effort chủ yếu xóa lỗi thiếu case. Ô chọn sai hướng vẫn còn.

Hardware, security, code review, bug trong codebase cũ hưởng lợi vì có nhiều chỗ khuất. Trên Fable 5.1, security từ 64% lên 87%, hardware từ 34% lên 75%. Operations và media vẫn thấp. Rulebook-style work không được effort cứu.

Không có người trong vòng lặp, high còn làm một việc khác: thử hai cách chuẩn bị dữ liệu, thấy kết quả đổi, rồi mới chọn. Có người trong vòng thì model đáng ra phải hỏi, không tự đoán.
Khi nào dùng mức nào
Thariq không để một mức suốt phiên. Với feature mới, vòng của anh ấy là: đưa spec và bắt model phỏng vấn chỗ còn thiếu, implement ở low, review ý chính rồi sửa tiếp ở low, verify và test ở high.
Thẻ anh ấy đăng trên X gói quy tắc lại thành bốn câu:

- Low: sketch, brainstorm, sửa dễ. Muốn trả lời nhanh và còn ở trong vòng.
- Medium: làm feature, việc ngày. Phần lớn software engineering thường.
- High: sửa bug, đuổi edge case, chỗ kiểm chứng quan trọng. Kể cả bug trong codebase cũ.
- Max: giao việc khó và để nó chạy hết, từ build đến verify. Ví dụ trong bài: dựng và kiểm một app, hoặc săn lỗ hổng ở phần mềm quan trọng.
Đổi bằng /effort, kể cả giữa cuộc. Đừng trả max để khỏi nghĩ. Đó là cách đắt nhất để model quyết thay anh những chỗ anh chưa nói.
TL;DR
- Effort là ngân sách compute, không phải độ thông minh.
- Spec chặt thì chênh lệch giữa các mức nhỏ lại.
- High vá edge case. Không vá hướng sai.
- Feature: phỏng vấn, làm ở low, kiểm ở high.
- Đổi bằng
/effort, kể cả giữa cuộc.
Tham khảo
- Thariq — Using Claude Code: Spending your effort (25/09/2026) https://x.com/trq212/status/2103576349499855160
- Bản có biểu đồ tương tác: https://claude.dev/blog/spending-your-effort/
- Ảnh trong bài lấy từ post X ở trên, không phải diagram tự vẽ.