inflearn logo

Xây dựng NPU MNIST với FPGA — Từ RTL đến kiểm chứng Bit-True

Đưa mạng thần kinh lên FPGA — cụm từ này nghe có vẻ quen thuộc, nhưng số người thực sự làm được điều đó lại rất hiếm. Nếu bạn muốn đi trước một bước trong các đồ án tốt nghiệp (Capstone), các cuộc thi hay tác phẩm tốt nghiệp, bạn cần phải vượt xa việc chỉ huấn luyện mô hình; bạn phải có khả năng tự mình tạo ra và chứng minh cách các phép toán đó vận hành bên trong một con chip thực thụ. Khóa học này sẽ giúp bạn lấp đầy khoảng cách đó — khoảng cách giữa lý thuyết và phần cứng thực tế. Bạn sẽ tự tay hoàn thiện từ đầu đến cuối một bộ tăng tốc mạng thần kinh (NPU) nhận dạng chữ số MNIST, từ việc đọc thông số kỹ thuật đến xây dựng mô hình Golden Model bằng Python, thiết kế Verilog RTL và kiểm chứng trên FPGA. Từ lớp Conv được tạo bởi Line Buffer và MAC song song, qua ReLU, MaxPool, Flatten cho đến lớp Fully Connected và Argmax — bạn sẽ tích hợp chín khối chức năng vào một con chip duy nhất và tự mình chứng minh rằng "kết quả từ Python và đầu ra phần cứng không khác nhau dù chỉ một bit (Bit-True)". Khóa học cũng bao gồm cách vượt qua những khoảnh khắc gây ức chế khi mô phỏng chạy bình thường nhưng kết quả lại khác biệt một cách tinh vi. Tôi sẽ chỉ ra từng bí quyết thực tế mà các giáo trình học sâu thông thường không đề cập đến, chẳng hạn như lượng tử hóa số nguyên, chuyển đổi thứ tự trục mảng, hay ngăn chặn tràn bộ tích lũy. Tôi đã đúc kết những kinh nghiệm xương máu từ quá trình thiết kế CPU RISC-V và kiểm chứng Bit-True trên FPGA trong thời gian dài vào khóa học này, để các bạn không phải lặp lại những sai lầm đó. Sau khi kết thúc khóa học, bạn sẽ nắm trong tay một dự án phần cứng hoàn chỉnh mà bạn có thể tự tin nói rằng mình đã "tự tay thiết kế và chứng minh".

1 học viên đang tham gia khóa học này

Độ khó Trung cấp trở lên

Thời gian Không giới hạn

Artificial Neural Network
Artificial Neural Network
Computer Vision(CV)
Computer Vision(CV)
Verilog HDL
Verilog HDL
FPGA
FPGA
verification
verification
Artificial Neural Network
Artificial Neural Network
Computer Vision(CV)
Computer Vision(CV)
Verilog HDL
Verilog HDL
FPGA
FPGA
verification
verification

Bạn sẽ nhận được điều này sau khi học.

  • Một dự án bộ tăng tốc mạng thần kinh (NPU) hoàn chỉnh từ đặc tả kỹ thuật đến RTL và kiểm chứng, có thể nộp cho đồ án Capstone, cuộc thi hoặc đồ án tốt nghiệp.

  • Toàn bộ quá trình từ việc cố định các hạn chế phần cứng trước, sau đó trực tiếp huấn luyện mạng thần kinh cho phù hợp, lượng tử hóa các trọng số đó thành số nguyên và triển khai lên phần cứng — không phải là việc sử dụng lại các trọng số có sẵn của người khác, mà là trải nghiệm tự mình xây dựng mọi thứ ngay từ khâu huấn luyện.

  • Khả năng kiểm chứng Bit-True trực tiếp chứng minh rằng đầu ra của phần cứng và kết quả từ Python không khác nhau dù chỉ một bit — Kỹ năng thay đổi từ "có vẻ như nó đang chạy" thành "đã chứng minh được sự trùng khớp hoàn toàn"

  • Khả năng thiết kế và triển khai trực tiếp Conv·ReLU·MaxPool·Flatten·Kết nối đầy đủ·Argmax bằng Verilog RTL (bao gồm line buffer, MAC song song, bộ tích lũy)

  • Bí quyết xử lý các cạm bẫy thực tế khi chuyển đổi trọng số dấu phẩy động đã huấn luyện sang số nguyên, chẳng hạn như chuyển đổi thứ tự trục, hiệu chỉnh chữ số và ngăn chặn tràn bộ tích lũy.

  • Kinh nghiệm tích hợp hệ thống trong việc tích hợp và kiểm chứng các khối riêng lẻ thành một chip duy nhất.

  • Bước đầu tiên trong thiết kế NPU ISA nhằm mở rộng bộ tăng tốc cố định thành bộ xử lý dựa trên tập lệnh

Xây dựng mạng thần kinh bằng chip, chứ không phải bằng phần mềm.

NPU nhận diện MNIST từ thông số kỹ thuật đến RTL và kiểm chứng — tự tay thiết kế và chứng minh đến từng bit.


Bạn đã bao giờ trăn trở về những điều này chưa?

Bạn đã thử huấn luyện mô hình nhưng không ai dạy cách đưa nó lên FPGA. Bạn đã từng làm việc với Verilog nhưng chưa bao giờ hoàn thiện toàn bộ mạng thần kinh dưới dạng một bộ tăng tốc duy nhất, và dù đã chọn chủ đề "Phần cứng AI" cho đồ án chuyên ngành hay đồ án tốt nghiệp, bạn vẫn thấy bế tắc không biết phải bắt đầu từ đâu. Khi chuyển đổi trọng số dấu phẩy động sang số nguyên, mô phỏng vẫn chạy nhưng kết quả lại bất thường, và dù đã xác nhận rằng "có vẻ như nó đang chạy" nhưng bạn lại không biết cách chứng minh liệu nó có thực sự đúng hay không.


Câu trả lời mà khóa học này mang lại

Khóa học này sẽ trực tiếp xây dựng bộ tăng tốc mạng thần kinh (NPU) nhận dạng chữ số MNIST, bắt đầu từ việc đọc thông số kỹ thuật, mô hình Golden bằng Python, huấn luyện phù hợp với các hạn chế phần cứng và lượng tử hóa số nguyên, thiết kế Verilog RTL, cho đến kiểm chứng Bit-True trên FPGA mà không bỏ qua bất kỳ bước nào.

Sau khi kết thúc khóa học, trong tay các bạn sẽ là một dự án phần cứng hoàn chỉnh có thể nộp ngay cho đồ án capstone, cuộc thi hay đồ án tốt nghiệp. Và bạn sẽ có thể tự tin nói rằng: "Tôi đã tự mình huấn luyện, thiết kế và chứng minh chính xác đến từng bit".


Bí quyết riêng của khóa học này

Thứ nhất, phần cứng trước, huấn luyện sau. Thay vì sử dụng các trọng số do người khác tạo ra, bạn sẽ cố định các ràng buộc phần cứng như độ rộng bit và thứ tự tính toán trước, sau đó trực tiếp huấn luyện mạng thần kinh sao cho phù hợp. Mô hình Python sẽ trở thành bản thiết kế chi tiết đến từng bit của RTL.

Thứ hai, thay đổi từ "có vẻ như đang hoạt động" thành "khớp chính xác". Đưa việc kiểm chứng Bit-True, chứng minh rằng mô hình Golden Python số nguyên và đầu ra RTL không khác biệt dù chỉ một bit, lên hàng đầu. Chúng tôi truyền tải nguyên vẹn những cạm bẫy trong thực tế, từ lý do tại sao dễ bị đánh lừa nếu chỉ khớp lớp (class) cho đến lý do tại sao cần kiểm chứng hàng loạt.

Thứ ba, tiến từ bộ tăng tốc sang bộ vi xử lý. Không chỉ dừng lại ở một ví dụ đơn lẻ, chúng tôi mở ra lộ trình mở rộng từ bộ tăng tốc cố định thành bộ vi xử lý được điều khiển bằng tập lệnh (NPU ISA).


Tổng quan chương trình học (7 phần · 10 bài giảng · 7 giờ 7 phút)

Phần 1. Ngôn ngữ thiết kế — Cách đọc thông số kỹ thuật MNIST NPU
Phần 2. Python — Đáp án chuẩn của phần cứng (Golden Model) và huấn luyện, lượng tử hóa số nguyên
Phần 3. Mạch trích xuất đặc trưng — Line buffer và MAC song song 4 kênh
Phần 4. Mạch chuyển đổi và quyết định — ReLU, MaxPool, Flatten, Kết nối đầy đủ và Argmax
Phần 5. Tích hợp và kiểm chứng — Chín khối trong một chip, chứng minh bằng Bit-True
Phần 6. Mở rộng — NPU ISA và trình biên dịch mini
Phần 7. Thiết lập môi trường thực hành — Kiểm tra bắt buộc trước khi mô phỏng


Đề xuất cho những đối tượng sau

Khuyên dùng cho sinh viên đại học đang chuẩn bị đồ án tốt nghiệp hoặc capstone về chủ đề phần cứng AI, những người tham gia cuộc thi cần kết quả nổi bật, các kỹ sư đang làm việc tại các công ty thiết kế muốn mở rộng năng lực sang mảng NPU và bộ tăng tốc AI, những kỹ sư phần cứng có tinh thần tự học muốn trải nghiệm thực tế việc chế tạo và chứng minh mà các sách lý thuyết chưa đáp ứng đủ, và những bạn đang chuẩn bị học cao học với định hướng nghề nghiệp về thiết kế NPU.


Kiến thức tiên quyết

Chỉ cần có kiến thức nền tảng về Verilog HDL và thiết kế logic kỹ thuật số là đủ. Với Python, bạn chỉ cần ở mức độ đọc và chạy được code, và không cần biết lý thuyết Deep Learning — các phép toán mạng thần kinh sẽ được giải thích từ đầu dưới góc độ phần cứng. Ngay cả khi bạn lần đầu sử dụng các công cụ FPGA, Phần 7 sẽ hướng dẫn bạn cách thiết lập môi trường.

Khuyến nghị cho
những người này

Khóa học này dành cho ai?

  • Kỹ sư phần cứng đang làm việc tại các công ty thiết kế và bán dẫn, muốn mở rộng năng lực sang lĩnh vực thiết kế bộ tăng tốc AI/NPU — Những người đã quen thuộc với thiết kế RTL nhưng cần kinh nghiệm trong việc hoàn thiện và kiểm chứng mạng thần kinh dưới dạng một bộ tăng tốc hoàn chỉnh.

  • Kỹ sư hướng đến sự phát triển bản thân, muốn không ngừng nâng cao năng lực ngay cả trong công việc thực tế bận rộn — Những người mong muốn các dự án thực chiến để tự tay xây dựng và chứng minh bằng Bit-True, điều mà chỉ riêng sách lý thuyết không thể đáp ứng được.

  • Sinh viên đại học chuyên ngành Điện - Điện tử - Bán dẫn đã chọn chủ đề "AI Hardware" cho đồ án tốt nghiệp/capstone nhưng đang cảm thấy bế tắc không biết làm thế nào để chuyển đổi mạng thần kinh sang RTL và triển khai lên FPGA.

  • Những người tham gia cần kết quả khác biệt trong cuộc thi — Những ai muốn thể hiện một "NPU tự thiết kế và được chứng minh bằng Bit-True" thay vì chỉ là huấn luyện mô hình

  • Sinh viên chuẩn bị học cao học muốn định hướng sự nghiệp thiết kế NPU và bộ tăng tốc AI, cần kinh nghiệm triển khai và kiểm chứng thực tế thay vì chỉ là lý thuyết.

Cần biết trước khi bắt đầu?

  • Khóa học này dành cho những người đã có kiến thức cơ bản về Verilog HDL và thiết kế logic kỹ thuật số.

  • Đối với Python, chỉ cần nắm vững ngữ pháp cơ bản ở mức có thể đọc và thực thi mã Golden Model là đủ.

  • Sẽ rất tốt nếu bạn đã từng sử dụng các công cụ mô phỏng FPGA.

Xin chào
Đây là EdgeChipLab

Là một giáo sư đại học đương nhiệm, tôi đã đúc kết 30 năm bí quyết về bán dẫn hệ thống.

Đây là chương trình giảng dạy thực tiễn được thiết kế và kiểm chứng trực tiếp bởi một giáo sư giảng dạy kỹ thuật bán dẫn, người đã từng bắt đầu với vị trí nghiên cứu viên bán dẫn hệ thống tại bộ phận DS của Samsung Electronics, trải qua các chức vụ Giám đốc tại chi nhánh Anh và Đức, cũng như Trưởng nhóm Marketing và Kinh doanh System LSI.

 

Vượt xa lý thuyết để tiến tới triển khai phần cứng thực tế, nâng tầm năng lực kỹ thuật của bạn.

Có những lĩnh vực mà những kiến thức rời rạc, vụn vặt không bao giờ có thể chạm tới. Học viên sẽ không chỉ đơn thuần là người dùng sử dụng các IP black-box đã hoàn thiện, mà sẽ phát triển thành một nhà cung cấp kiến trúc hệ thống (system architect) – người có thể thiết kế NPU, CPU, tích hợp các thiết bị ngoại vi và cuối cùng là tự xây dựng nên AI SoC của riêng mình.

 

Đây không phải là bài giảng chỉ để xem bằng mắt. Chúng tôi cam kết hiện thực hóa phần cứng 100% và xác minh Bit-True.

Không chỉ dừng lại ở lý thuyết hay mô phỏng đơn thuần. Hãy trực tiếp trải nghiệm cảm giác phấn khích khi chứng kiến các nghiên cứu học thuật được công bố trên KCI của chính giảng viên và các mạch điện tự thiết kế hoạt động chính xác tuyệt đối trên phần cứng FPGA thực tế. Mọi mã nguồn, bao gồm cả CPU RISC-V tự phát triển, đều được công khai minh bạch, cho phép bất kỳ ai cũng có thể tự do sử dụng để tái hiện và kiểm chứng chỉ với bo mạch FPGA phổ thông (Arty S7-25) và công cụ miễn phí (Vivado).

 

Lộ trình full-stack liền mạch: Từ cơ bản đến bộ tăng tốc mini LLM

Tất cả các bài giảng không phải là những mảnh ghép rời rạc, mà là một hành trình để hoàn thiện một hệ thống khổng lồ duy nhất.

  • Bước 1: Lý thuyết AI và cơ bản về xử lý hình ảnh (bao gồm Machine Learning)

  • Step 2: Thiết kế và kiểm chứng bộ tăng tốc AI (NPU) (Bao gồm Machine Learning)

  • Step 3: Thiết kế CPU RISC-V và Tích hợp hệ thống

  • Bước 4: Triển khai AI SoC nâng cao và mở rộng sang nền tảng tăng tốc mini LLM (Cập nhật nội dung liên tục)

     

 

Chỉ số kiểm chứng khách quan

Tất cả các kết quả thiết kế của khóa học này đều đã trải qua quá trình kiểm chứng nghiêm ngặt từ các tiêu chuẩn quốc tế và giới học thuật.

  • Kiểm chứng kiến trúc RISC-V: CPU RISC-V tự phát triển, vượt qua bài kiểm tra tuân thủ chính thức (ACT) của tổ chức quốc tế và công khai mã nguồn (GitHub)

  • Uy tín học thuật: 4 bài báo khoa học với tư cách là tác giả duy nhất (Tạp chí uy tín hạng A của KCI - IJIBC)

  • Công nhận toàn cầu: Xuất bản 2 cuốn sách kỹ thuật trên Amazon toàn cầu (Đạt hạng 3 sách bán chạy nhất)

  • Đã hoàn thành xác minh vận hành thực tế: Các IP cốt lõi như RV32I CPU, NPU, hệ thống thị giác, GPS, Transformer, AURA-Edge SoC hoạt động hoàn hảo trên môi trường Arty S7.

Hãy thử thách bản thân. Đến khi kết thúc quá trình tự mình nạp code lên board và kiểm tra kết quả này, bạn sẽ được nâng cấp thành một kỹ sư phần cứng với tầm nhìn hoàn toàn khác biệt so với trước đây.

Thêm

Chương trình giảng dạy

Tất cả

10 bài giảng ∙ (4giờ 39phút)

Ngày đăng: 
Cập nhật lần cuối: 

Đánh giá

Chưa có đủ đánh giá.
Hãy trở thành tác giả của một đánh giá giúp mọi người!

Khóa học khác của EdgeChipLab

Hãy khám phá các khóa học khác của giảng viên!

Khóa học tương tự

Khám phá các khóa học khác trong cùng lĩnh vực!

Ưu đãi có thời hạn

158.400 ₫

40%

5.516.804 ₫