Kafka & Spark được sử dụng cho Realtime Datalake
hyunjinkim
Khóa học nhập môn Pipeline thời gian thực Kafka & Spark dành cho người mới bắt đầu. Khóa học trọn gói để nắm vững từ khái niệm cốt lõi đến kiến trúc.
Cơ bản
Kafka, Apache Spark, pyspark
Tìm hiểu về kiến trúc LLM dựa trên Transformer và chiến lược sử dụng GPU, đồng thời thực hành trực tiếp quy trình phục vụ (serving) thực tế bằng vLLM. Khóa học bao gồm toàn bộ quy trình làm việc thực tế từ xây dựng đường ống hệ thống AI đến giám sát và sử dụng đa GPU, được thiết kế để người học có thể hiểu một cách trực quan thông qua hình ảnh và thực hành mà không cần các công thức phức tạp.
257 học viên
Độ khó Cơ bản
Thời gian Không giới hạn
Đánh giá từ những học viên đầu tiên
5.0
WonJune Lee
Tôi không làm việc trong lĩnh vực liên quan đến Deep Learning mà đang làm trong mảng Computer Vision (rule-based). Vì công ty cần các kỹ thuật về LLM và Deep Learning cho Vision nên tôi đang nghiên cứu về chủ đề này. Mặc dù mới chỉ học được khoảng 40% nhưng tôi cảm thấy mình phải viết đánh giá ngay nên đã đăng bài này. Tôi đã nghe rất nhiều bài giảng về Deep Learning, kể cả những bài giảng của những người nổi tiếng và được đánh giá tốt, nhưng chưa có bài giảng nào súc tích và mạch lạc như bài giảng này. Điều tuyệt vời nhất là chất lượng tài liệu bài giảng rất xuất sắc. Tác giả đã ghi lại từng phép tính ma trận bằng Excel, điều này giúp ích rất nhiều khi ôn tập. Mã nguồn Python cũng được chú thích ở rất nhiều chỗ. Chất lượng bài giảng cũng rất tốt, những phần mà học viên có thể quên đều được nhắc lại để không bị bỏ lỡ. Trong khi hầu hết các bài giảng khác chỉ trình bày phép tính một hai lần rồi bỏ qua, thì ở bài giảng này, giảng viên cùng thực hiện phép tính cho đến cuối cùng, giúp mọi thứ trở nên rõ ràng và chuẩn xác. Phần Q&A cũng được kiểm tra thường xuyên, khi tôi đặt câu hỏi là được phản hồi ngay lập tức nên rất thích. Có vẻ bài giảng được quay trong năm nay nên có rất nhiều nội dung về các xu hướng mới nhất. Có vẻ bài giảng này vẫn chưa được nhiều người biết đến, nhưng tôi thực sự nhiệt liệt đề xuất cho những ai cần học về chủ đề liên quan.
5.0
정현욱
Cảm ơn bạn đã giải thích dễ hiểu.
5.0
illheon
Rất tốt để làm quen hoặc bắt đầu với đề tài này.
Hiểu cấu trúc encoder-decoder và nguyên lý hoạt động cốt lõi của mô hình Transformer
Hiểu luồng phát triển của các cơ chế Attention mới nhất như MHA, MQA, GQA, MLA, v.v.
Thực hành cách sử dụng công cụ vLLM, tiêu chuẩn thực tế trong việc phục vụ AI hiện nay.
Giám sát các chỉ số hiệu suất chính như TTFT, TPOT trong môi trường phục vụ vLLM
Thiết kế và triển khai kiến trúc đa GPU sử dụng Tensor/Pipeline/Data Parallel
Hiểu khái niệm cốt lõi của Agent AI và nguyên lý hoạt động của Tool Calling
Kinh nghiệm xây dựng đường ống hệ thống AI (AI system pipeline) và giám sát hiệu suất từ góc độ thực tế trong công việc.
Hiểu các xu hướng LLM mới nhất như MLA, MTP, N-gram dựa trên các bài báo nghiên cứu mới nhất
Trong kỷ nguyên AI Agent tự hành,
bạn có thể tận dụng nhiều công cụ Agent và Public API khác nhau như OpenAI, Claude, Codex.
Tuy nhiên, trong môi trường dịch vụ thực tế, chúng ta cần phải cân nhắc đồng thời cả
bảo mật dữ liệu, chi phí mạng, chi phí token và quản lý tài nguyên GPU.
Vì vậy, điều quan trọng là
sự hiểu biết về kiến trúc Hybrid AI, nơi kết hợp giữa Public API và LLM dựa trên GPU riêng
sao cho phù hợp với từng tình huống.
according to the situation.
Vậy liệu việc chỉ sử dụng Public API có luôn là lựa chọn tốt nhất không?
Không hẳn là như vậy.
Dạo gần đây, có rất nhiều LLM đang được phát triển ở cả trong và ngoài nước với hiệu năng tương đương với các public API (chatGPT, Claude, Sonnet etc.)
.
Tuy nhiên, việc hiểu rõ và sử dụng LLM không hề dễ dàng.
Việc sở hữu những GPU đắt tiền rồi
sử dụng LLM có sự hiểu biết so với việc sử dụng mà không hiểu biết
sẽ mang lại sự khác biệt rất lớn.
Chào đón kỷ nguyên của các đại lý (agent), giờ đây là thời đại của suy luận (inference) thay vì học máy (learning). Việc sử dụng tốt các Public API là cần thiết, nhưng nhiều doanh nghiệp vẫn ưu tiên xây dựng môi trường phục vụ (serving) tại địa phương vì nhiều lý do như bảo mật, quản trị và chi phí. Hãy tìm hiểu mọi thứ từ việc thấu hiểu kiến trúc LLM để xây dựng môi trường phục vụ LLM tại địa phương, cho đến cấu trúc kiến trúc và các xu hướng phát triển LLM.
Bạn cần phải hiểu rõ vô số LLM được công khai trên Hugging Face trước khi sử dụng.
Tuy nhiên, tệp config.json cung cấp thông số kỹ thuật của mô hình LLM chẳng khác nào một bản mật mã đối với người mới bắt đầu. Bởi vì bạn phải hiểu về mô hình Transformer thì mới có thể đọc hiểu được nó.
Nhưng đừng lo lắng. Sau khi nghe bài giảng này, bạn sẽ có thể trở thành một chuyên gia có thể nhìn và hiểu được các thông số kỹ thuật chính.
(Đây là nội dung của phần Chương 3-5. Hãy nắm bắt tất cả các thông số chính còn lại nhé)
Điểm bắt đầu và kết thúc của mô hình Transformer, nền tảng của các mô hình LLM hiện nay, chính là Attention.
attention-model đã xuất hiện từ năm 2017 nhưng
vẫn đang thống trị như một thuật toán mạnh mẽ nhất trong gần 10 năm qua.
Mặc dù đã có nhiều nỗ lực để thoát khỏi cấu trúc Transformer,
nhưng cho đến nay vẫn chưa có kiến trúc nào thay thế hoàn toàn được Attention của Transformer.
⚠️ Tuyệt đối không được hiểu về Attention một cách hời hợt.
(Đây là nội dung thuộc phần Chương 5-4. Dòng chảy phát triển của Attention cũng chính là dòng chảy phát triển của LLM)
Việc cấu hình đa GPU là điều bắt buộc để vận hành các mô hình LLM quy mô lớn và suy luận nhanh chóng.
Tuy nhiên, bạn có biết rằng cũng có rất nhiều phương pháp khác nhau để cấu hình đa GPU không?
Những người muốn học về cấu trúc Transformer và Attention nhưng cảm thấy khó khăn vì các công thức và khái niệm phức tạp
Đã từng sử dụng ChatGPT hoặc các dịch vụ AI tạo sinh, nhưng muốn hiểu rõ nguyên lý hoạt động thực tế của LLM
Kỹ sư AI cần hiểu về kiến trúc LLM và môi trường GPU,
cũng như cần có năng lực xây dựng và vận hành hệ thống AI thực tế
Hiểu về mô hình Transformer
Tokenizer & Embedding
Encoder vs Decoder
Xem mã nguồn mô hình
Chinh phục mô hình Decoder
Làm chủ Attention
Masked Attention
KV Cache
vLLM Serving
Paged Attention
Tương thích với OpenAI
Giao thức SSE
Hiểu về Tool Call
Cấu trúc phản hồi của Tool
Chat Template
Bộ phân tích cú pháp gọi công cụ (Tool call parser)
Kiểm tra hiệu năng
Giám sát vLLM
Multi-GPU & Parallelism
Các tính năng bổ sung của vLLM
Dự đoán đa mã thông báo (Multi Token Prediction)
mHC
Engram
Những nỗ lực để vượt qua giới hạn
Nguyên lý cốt lõi của Attention học không cần công thức
Học các kỹ thuật Attention đa dạng một cách trực quan thông qua Excel mà không cần công thức (MHA → MQA → GQA, Sliding Window Attention)
Triển khai kiến trúc AI cấu trúc 3 lớp (3 Tier)
Hiểu cấu trúc cơ bản của kiến trúc 3 lớp (3-Tier) kết nối OpenWebUI, FastAPI và vLLM, đồng thời học luồng cơ bản của việc tích hợp Tool.
Đo lường số lượng người dùng đồng thời và mẹo vận hành vLLM
Sử dụng jMeter để thực hiện kiểm tra tải (load test) từ FastAPI → vLLM nhằm xác nhận các chỉ số như TTFT, TPOT tùy theo số lượng người dùng đồng thời.
Giám sát dịch vụ vLLM
Xây dựng pipeline dashboard Prometheus & Grafana để nắm vững các nguyên lý cơ bản về vận hành dịch vụ vLLM.
Kiểm tra Đơn GPU / Đa GPU
Thông qua việc thực hành về 3 loại đa GPU cơ bản (Pipeline Parallel, Tensor Parallel, Data Parallel), bạn sẽ trực tiếp tận mắt xác nhận lý do tại sao cần phải sử dụng đa GPU.
Chinh phục xu hướng phát triển LLM
Giới thiệu các kỹ thuật mới nhất của DeepSeek như MTP, Shared MoE, MLA, Engram và các xu hướng phát triển LLM đang được thực hiện để tối ưu hóa hiệu suất suy luận.
Việc xây dựng hệ thống vLLM sẽ được thực hiện bằng cách sử dụng Runpod. Ngoài ra, các bài thực hành sử dụng GPU T4 của Google Colab cũng sẽ được tiến hành song song. Vì GPU T4 cung cấp 15GB bộ nhớ GPU, nên những bài thực hành nào có thể thực hiện được trên Colab sẽ được tiến hành trên Colab.
Chúng tôi sẽ thiết lập môi trường thực hành dựa trên luồng OpenWebUI → FastAPI → Runpod. Chúng tôi sẽ cài đặt vLLM trên máy chủ GPU của đám mây Runpod để tiến hành nhiều bài thực hành khác nhau.
Chi phí thực hành sẽ tốn khoảng $10 ~ $20.
Google Colab, vốn được coi là môi trường thực hành tiêu chuẩn cho trí tuệ nhân tạo (AI), sẽ được sử dụng cho các bài thực hành đơn giản không yêu cầu môi trường Runpod. Chúng ta sẽ tiến hành với gói miễn phí thông thường thay vì bản Pro và sử dụng GPU T4.
Dịch vụ vLLM được chạy trên Runpod nhưng
OpenwebUI và FastAPI cũng sẽ được chạy trên máy tính cá nhân của bạn khi tham gia khóa học.
Vì vậy, vui lòng kiểm tra xem môi trường học tập dưới đây có được đáp ứng hay không!
Tốc độ cập nhật của vLLM rất nhanh. Tuy nhiên, phiên bản chính (Major version) hiện vẫn đang ở mức 0.x.
Mặc dù vậy, nhiều doanh nghiệp vẫn đang sử dụng vLLM như một tiêu chuẩn thực tế cho công cụ suy luận (inference engine).
vLLM không chỉ hỗ trợ mô hình Transformer vốn là trụ cột của LLM hiện nay, mà còn hỗ trợ cả kiến trúc Mamba mới nổi lên như một sự thay thế, và mỗi khi các tính năng mới được thêm vào mô hình như Multi Token Prediction, vLLM đều được cập nhật để hỗ trợ chúng.
Khóa học này cũng sẽ được cập nhật khi các tính năng mới của vLLM hoặc các loại mô hình mới ra đời.
Khóa học này dành cho ai?
Người làm chuyên môn đang sử dụng ChatGPT và AI tạo sinh, nhưng muốn hiểu cách thức hoạt động thực sự của LLM.
Người mới bắt đầu có mục tiêu trở thành kỹ sư AI và muốn học về phục vụ LLM (LLM serving) cũng như cấu trúc hệ thống một cách bài bản.
Dành cho những nhà phát triển muốn thấu hiểu cấu trúc Transformer và Attention dưới góc nhìn thực tiễn mà không cần đến những công thức toán học phức tạp.
Kỹ sư backend và hạ tầng muốn tìm hiểu về luồng xây dựng hệ thống AI thực tế trong môi trường đa GPU và tối ưu hóa GPU.
PM và người lập kế hoạch muốn hiểu về cấu trúc LLM và chiến lược sử dụng GPU trong quá trình lập kế hoạch và phát triển dịch vụ AI.
Cần biết trước khi bắt đầu?
Hiểu biết về cú pháp cơ bản của Python (biến, hàm, câu lệnh điều kiện, v.v.)
Cách sử dụng cơ bản về git
Xác minh Inflearn
1,733
Học viên
126
Đánh giá
249
Trả lời
4.9
Xếp hạng
3
Các khóa học
Xin chào.
Tôi là một người đang làm việc trong lĩnh vực Dữ liệu & AI tại một tập đoàn lớn với 17 năm kinh nghiệm.
Sau khi đạt được bằng Kỹ sư Công nghệ Thông tin (Information Management Professional Engineer), tôi đang xây dựng nội dung nhằm chia sẻ những kiến thức đã tích lũy được cho nhiều người.
Rất vui được gặp bạn. :)
Liên hệ: hjkim_sun@naver.com
Tất cả
54 bài giảng ∙ (14giờ 27phút)
Tài liệu khóa học:
Tất cả
23 đánh giá
5.0
23 đánh giá
Đánh giá 2
∙
Đánh giá trung bình 4.5
Đánh giá 3
∙
Đánh giá trung bình 4.7
5
Tôi thực sự ngạc nhiên trước một bài giảng vô cùng chuyên nghiệp và chi tiết hơn nhiều so với những gì tôi tưởng tượng. Đã lâu rồi tôi mới thấy một bài giảng có chất lượng như thế này.. Vì công việc của tôi là kỹ sư liên quan đến AI, nên tôi đã mua khóa học với ý định chỉ học sơ qua về kiến thức cơ bản của Kiến trúc LLM (LLM Architecture) thôi, nhưng tôi cảm thấy cực kỳ hài lòng.
Đánh giá 4
∙
Đánh giá trung bình 5.0
Đánh giá 3
∙
Đánh giá trung bình 3.7
Đánh giá 3
∙
Đánh giá trung bình 5.0
Đã chỉnh sửa
5
Tôi không làm việc trong lĩnh vực liên quan đến Deep Learning mà đang làm trong mảng Computer Vision (rule-based). Vì công ty cần các kỹ thuật về LLM và Deep Learning cho Vision nên tôi đang nghiên cứu về chủ đề này. Mặc dù mới chỉ học được khoảng 40% nhưng tôi cảm thấy mình phải viết đánh giá ngay nên đã đăng bài này. Tôi đã nghe rất nhiều bài giảng về Deep Learning, kể cả những bài giảng của những người nổi tiếng và được đánh giá tốt, nhưng chưa có bài giảng nào súc tích và mạch lạc như bài giảng này. Điều tuyệt vời nhất là chất lượng tài liệu bài giảng rất xuất sắc. Tác giả đã ghi lại từng phép tính ma trận bằng Excel, điều này giúp ích rất nhiều khi ôn tập. Mã nguồn Python cũng được chú thích ở rất nhiều chỗ. Chất lượng bài giảng cũng rất tốt, những phần mà học viên có thể quên đều được nhắc lại để không bị bỏ lỡ. Trong khi hầu hết các bài giảng khác chỉ trình bày phép tính một hai lần rồi bỏ qua, thì ở bài giảng này, giảng viên cùng thực hiện phép tính cho đến cuối cùng, giúp mọi thứ trở nên rõ ràng và chuẩn xác. Phần Q&A cũng được kiểm tra thường xuyên, khi tôi đặt câu hỏi là được phản hồi ngay lập tức nên rất thích. Có vẻ bài giảng được quay trong năm nay nên có rất nhiều nội dung về các xu hướng mới nhất. Có vẻ bài giảng này vẫn chưa được nhiều người biết đến, nhưng tôi thực sự nhiệt liệt đề xuất cho những ai cần học về chủ đề liên quan.
Chào bạn Wonjune lee, Cảm ơn bạn rất nhiều vì những đánh giá khóa học đầy tâm huyết! Tôi đã suy nghĩ rất nhiều để nâng cao chất lượng tài liệu bài giảng, sao cho học viên nhận được những tài liệu thực sự ý nghĩa và có thể dùng để ôn tập hiệu quả ngay cả sau này. Bên cạnh đó, tôi cũng đã trăn trở rất nhiều về việc làm thế nào để truyền tải các phép toán như Attention một cách hiệu quả nhất. Kết luận của tôi là không thể chỉ nhìn qua công thức, cũng không thể chỉ truyền tải qua những ví dụ so sánh đơn giản, và càng không thể chỉ giải thích bằng mã nguồn torch. Với suy nghĩ rằng chỉ khi tận mắt theo dõi luồng dữ liệu thì mới có thể hiểu được, tôi đã cố gắng giải thích tối đa bằng Excel, và tôi rất vui vì có vẻ như điều đó đã được truyền tải tốt đến bạn :) Hy vọng bạn sẽ hoàn thành tốt phần còn lại của khóa học và thu nhận được nhiều nội dung bổ ích. Cố lên nhé!
Hãy khám phá các khóa học khác của giảng viên!
Khám phá các khóa học khác trong cùng lĩnh vực!