Rất nhiều người học AI theo một vòng lặp khá tốn thời gian: mua course, gom certificate, xem tutorial liên tục, bookmark hàng đống resource rồi vẫn không build ra được thứ gì có thể chạy thật.
Vấn đề không hẳn là thiếu tài liệu. Ngược lại, tài liệu free bây giờ quá nhiều. Thứ còn thiếu thường là thứ tự học, độ sâu cần chạm ở mỗi phase, và quan trọng nhất là một nguyên tắc rất cứng: học tới đâu phải build tới đó.
Bài này viết lại roadmap theo hướng thực dụng hơn. Mục tiêu không phải biến anh thành người “biết dùng AI tool”, mà là người có thể hiểu các lớp chính của modern AI systems, build được project tử tế, và deploy nó ra ngoài với mức kiểm soát tối thiểu.
Table of contents
Open Table of contents
- Nhìn tổng thể trước
- Nguyên tắc quan trọng nhất
- Phase 1: Setup môi trường cho đúng ngay từ đầu
- Phase 2: AI fundamentals, nhưng học để giải thích lại được
- Phase 3: Machine Learning foundation để hết ảo giác
- Phase 4: Deep learning để hiểu cái đang chạy bên dưới
- Phase 5: LLM engineering mới là chỗ build app nghiêm túc bắt đầu
- Phase 6: Agents, tool use và MCP
- Phase 7: Deploy, evaluate, và portfolio
- Một lộ trình 14 tuần gọn mà không quá ảo
- Những lỗi người mới hay mắc nhất
- Chọn project thế nào cho đáng công
- Chốt lại
Nhìn tổng thể trước
Roadmap này hợp với một người:
- đã biết code ở mức căn bản hoặc trung bình,
- chưa có nền AI quá sâu,
- muốn đi từ hiểu khái niệm sang build được hệ thật,
- và không muốn sa vào kiểu học vô tận mà không ship gì.
Thay vì gom 50 resource, mình chia thành vài phase rõ ràng. Mỗi phase đều phải kết thúc bằng một artifact:
- note giải thích lại được,
- repo có code,
- demo chạy được,
- hoặc hệ đã deploy.
Minh hoạ này tóm tắt một hướng đi 14 tuần: học theo phase, build theo output, và luôn có mốc ship rõ ràng.
Nguyên tắc quan trọng nhất
Đừng học AI như học thuộc glossary.
Thứ đáng tiền nhất không phải số lượng video anh đã xem, mà là số lần anh:
- mở terminal,
- tự chạy thử,
- làm hỏng một pipeline,
- sửa nó,
- rồi hiểu vì sao nó hỏng.
Nếu một phase học xong mà không để lại artifact nào có thể kiểm tra, thì gần như chắc là anh mới chỉ tiêu thụ nội dung chứ chưa thật sự nội hoá kỹ năng.
Phase 1: Setup môi trường cho đúng ngay từ đầu
Phần này nghe chán, nhưng bỏ qua là trả giá sau.
Cấu hình tối thiểu nên có:
- Python 3.11+
- VS Code
- GitHub
- Obsidian hoặc một nơi ghi note có cấu trúc
- Ollama để chạy model local
Ollama đáng giữ trong stack không phải vì lúc nào cũng dùng model local, mà vì nó giúp anh chạm tay vào mấy khái niệm rất thực:
- model weights,
- quantization,
- latency cục bộ,
- embeddings local,
- và sự khác nhau giữa “dùng API” với “vận hành model”.
Kết thúc phase này, anh nên có một môi trường dev sạch, có repo riêng cho phần học/build AI, và không còn bị vướng bởi setup linh tinh mỗi lần muốn thử gì mới.
Phase 2: AI fundamentals, nhưng học để giải thích lại được
Đây là đoạn nhiều người nhảy cóc. Họ muốn làm agent ngay, làm RAG ngay, fine-tune ngay, nhưng chưa thật sự nắm được:
- token là gì,
- embedding dùng để làm gì,
- transformer khác gì với intuition kiểu “AI đoán chữ tiếp theo”,
- context window giải quyết được gì và không giải quyết được gì.
Mục tiêu ở phase này không phải học toán sâu. Mục tiêu là anh phải giải thích bằng tiếng thường được các khái niệm nền:
- prompt hoạt động ra sao,
- vì sao model quên,
- vì sao context không phải memory,
- và vì sao RAG không đồng nghĩa với “ném file vào vector DB”.
Nếu không làm được bước này, các phase sau sẽ rất dễ biến thành copy-paste tutorial.
Phase 3: Machine Learning foundation để hết ảo giác
Đây thường là chỗ phép màu bắt đầu hết và engineering bắt đầu vào việc.
Anh cần chạm qua:
- regression,
- classification,
- clustering,
- overfitting,
- evaluation,
- gradient descent.
Lý do không phải để đi thi học thuật. Lý do là vì nếu không hiểu failure mode của model truyền thống, anh cũng khó đọc đúng failure mode của LLM systems.
Ví dụ:
- model trả sai chưa chắc vì prompt tệ,
- retrieval fail chưa chắc vì embedding model yếu,
- kết quả ổn trên demo chưa chắc đánh đổi được sang production.
Kết thúc phase này, nên có ít nhất một project ML nhỏ được push lên GitHub. Không cần hoành tráng. Một repo gọn, giải thích đúng problem, training flow, metrics và limitation đã có giá trị hơn mười cái cert.
Phase 4: Deep learning để hiểu cái đang chạy bên dưới
Đây là đoạn nên đi chậm hơn một chút.
Anh không nhất thiết phải tự train model lớn, nhưng nên hiểu được theo cách “có thể rebuild lại phiên bản tối giản”:
- neural network cơ bản,
- backpropagation,
- activation,
- tokenization,
- attention,
- và transformer block.
Giá trị lớn nhất của phase này là xoá bớt cảm giác huyền bí. Khi anh đã từng tự build một phiên bản nhỏ bằng Python hoặc notebook, các từ như attention, hidden state, hay token embedding sẽ bớt mơ hồ hẳn.
Nếu làm song song với model local trên Ollama thì còn tốt hơn, vì lúc đó anh vừa nhìn được hệ thật, vừa hiểu được abstraction bên dưới.
Phase 5: LLM engineering mới là chỗ build app nghiêm túc bắt đầu
Sau khi nền đã đủ, đây mới là lúc các buzzword thực sự có ý nghĩa:
- RAG
- fine-tuning
- LoRA / QLoRA
- quantization
- vector database
- evaluation
Điểm mấu chốt là đừng học mấy thứ này như checklist. Học theo câu hỏi:
- Khi nào cần RAG thay vì nhét thêm context?
- Khi nào nên fine-tune, khi nào không?
- Vector DB khác exact lookup ở chỗ nào?
- Eval cho LLM system khác unit test thường ở đâu?
Project hợp lý nhất ở phase này thường là một RAG app gắn với dữ liệu thật:
- note cá nhân,
- docs nội bộ,
- knowledge base,
- hoặc một corpus hẹp nhưng có ích.
Làm tới đây anh bắt đầu có thứ có thể demo mà không bị quá toy.
Phase 6: Agents, tool use và MCP
Đây là chỗ thị trường hay hype mạnh nhất, và cũng là chỗ dễ làm demo ấn tượng nhưng mong manh nhất.
Nếu muốn bước qua phase này cho tử tế, anh phải quan tâm tới:
- tool schema,
- orchestration,
- memory,
- workflow,
- idempotency,
- loop limit,
- trace,
- và permission boundary.
Nói cách khác, agent không phải chỉ là “cho model gọi tool”. Nó là một bài toán hệ thống.
MCP cũng quan trọng ở đây vì nó giúp tách phần model khỏi phần kết nối tool / environment theo cách chuẩn hoá hơn. Nếu anh định build AI systems có tuổi thọ dài hơn một weekend project, đây là hướng nên theo dõi nghiêm túc.
Artifact tốt ở phase này là một agent nhỏ nhưng sống thật:
- research agent,
- browser agent,
- file workflow agent,
- local assistant có memory,
- hoặc system automation có guardrail rõ.
Phase 7: Deploy, evaluate, và portfolio
Rất nhiều tutorial dừng ở bước “nó chạy trên máy em rồi”. Đó là chỗ thiếu nhất.
Một AI system chưa có evaluation thì rất dễ chỉ là hallucination machine được bọc UI đẹp.
Tới phase này, anh phải bắt đầu quan tâm:
- demo public,
- evaluation set nhỏ nhưng thật,
- safety checks,
- cost,
- latency,
- observability,
- documentation.
Tool nào dùng cũng được, miễn hệ ra được ngoài:
- Hugging Face Spaces
- Gradio
- Streamlit
- Vercel
Repo tốt ở giai đoạn này không còn chỉ là code. Nó phải cho người khác thấy:
- bài toán là gì,
- system hoạt động ra sao,
- giới hạn ở đâu,
- đo chất lượng bằng gì,
- và demo dùng được ở đâu.
Một lộ trình 14 tuần gọn mà không quá ảo
Nếu ép thành một plan gọn, anh có thể đi như này:
Tuần 1-2
- setup môi trường,
- học AI fundamentals,
- viết lại note giải thích tokens, embeddings, context window.
Tuần 3-4
- học ML foundation,
- làm một project nhỏ,
- push repo đầu tiên.
Tuần 5-6
- đi qua deep learning cơ bản,
- build vài notebook hoặc mini implementation để hiểu attention và transformer.
Tuần 7-9
- làm LLM engineering,
- build một RAG app tử tế,
- thêm evaluation tối thiểu.
Tuần 10-11
- thêm agent/tool use,
- thử memory,
- dựng workflow nhiều bước.
Tuần 12-14
- deploy,
- viết docs,
- thêm demo public,
- hoàn thiện repo theo kiểu có thể show cho người khác.
Con số 14 tuần không phải luật cứng. Nó chỉ là một khung đủ chặt để không học mãi mà không build.
Những lỗi người mới hay mắc nhất
- nhảy vào agent khi chưa hiểu model và retrieval,
- học prompt mẹo vặt nhưng không hiểu output validation,
- phụ thuộc tutorial framework mà không hiểu layer bên dưới,
- coi deploy là việc để sau,
- và đánh đồng “xem nhiều” với “làm được”.
Một lỗi nữa cũng rất phổ biến: build quá nhiều toy project mà không có cái nào đi hết vòng đời từ idea tới deploy. Một project đi trọn vòng thường dạy nhiều hơn năm demo nửa vời.
Chọn project thế nào cho đáng công
Project tốt cho roadmap này nên có ít nhất ba yếu tố:
- chạm dữ liệu thật,
- có evaluation hoặc feedback loop,
- và có người dùng được, kể cả chỉ là chính anh.
Ví dụ hợp lý:
- RAG cho kho note cá nhân,
- AI assistant cho một workflow nội bộ,
- agent nghiên cứu có lưu trace,
- hoặc một hệ Q&A hẹp nhưng deploy public được.
Project tệ thường là project chỉ có vẻ ngoài AI nhưng không có chỗ nào để đo chất lượng thật.
Chốt lại
Roadmap tốt không cố làm anh thấy AI dễ. Nó giúp anh đi đúng thứ tự.
Điều đáng theo đuổi không phải là trở thành người biết nhiều resource nhất, mà là người có thể:
- hiểu model đang làm gì,
- build được hệ quanh model,
- deploy ra môi trường thật,
- và đánh giá được khi nào hệ đó đáng tin, khi nào không.
Nếu giữ đúng nhịp học theo phase, build theo artifact, và deploy trước khi tự tin quá sớm, thì sau vài tháng anh sẽ khác hẳn kiểu người chỉ nói về AI bằng link với certificate.