Xây dựng NPU MNIST với FPGA — Từ RTL đến kiểm chứng Bit-True

Đưa mạng thần kinh lên FPGA — cụm từ này nghe có vẻ quen thuộc, nhưng số người thực sự làm được điều đó lại rất hiếm. Nếu bạn muốn đi trước một bước trong các đồ án tốt nghiệp (Capstone), các cuộc thi hay tác phẩm tốt nghiệp, bạn cần phải vượt xa việc chỉ huấn luyện mô hình; bạn phải có khả năng tự mình tạo ra và chứng minh cách các phép toán đó vận hành bên trong một con chip thực thụ. Khóa học này sẽ giúp bạn lấp đầy khoảng cách đó — khoảng cách giữa lý thuyết và phần cứng thực tế. Bạn sẽ tự tay hoàn thiện từ đầu đến cuối một bộ tăng tốc mạng thần kinh (NPU) nhận dạng chữ số MNIST, từ việc đọc thông số kỹ thuật đến xây dựng mô hình Golden Model bằng Python, thiết kế Verilog RTL và kiểm chứng trên FPGA. Từ lớp Conv được tạo bởi Line Buffer và MAC song song, qua ReLU, MaxPool, Flatten cho đến lớp Fully Connected và Argmax — bạn sẽ tích hợp chín khối chức năng vào một con chip duy nhất và tự mình chứng minh rằng "kết quả từ Python và đầu ra phần cứng không khác nhau dù chỉ một bit (Bit-True)". Khóa học cũng bao gồm cách vượt qua những khoảnh khắc gây ức chế khi mô phỏng chạy bình thường nhưng kết quả lại khác biệt một cách tinh vi. Tôi sẽ chỉ ra từng bí quyết thực tế mà các giáo trình học sâu thông thường không đề cập đến, chẳng hạn như lượng tử hóa số nguyên, chuyển đổi thứ tự trục mảng, hay ngăn chặn tràn bộ tích lũy. Tôi đã đúc kết những kinh nghiệm xương máu từ quá trình thiết kế CPU RISC-V và kiểm chứng Bit-True trên FPGA trong thời gian dài vào khóa học này, để các bạn không phải lặp lại những sai lầm đó. Sau khi kết thúc khóa học, bạn sẽ nắm trong tay một dự án phần cứng hoàn chỉnh mà bạn có thể tự tin nói rằng mình đã "tự tay thiết kế và chứng minh".

8 học viên đang tham gia khóa học này

Độ khó Trung cấp trở lên

Thời gian Không giới hạn

Artificial Neural Network
Artificial Neural Network
Computer Vision(CV)
Computer Vision(CV)
Verilog HDL
Verilog HDL
FPGA
FPGA
verification
verification
Artificial Neural Network
Artificial Neural Network
Computer Vision(CV)
Computer Vision(CV)
Verilog HDL
Verilog HDL
FPGA
FPGA
verification
verification

Bạn sẽ nhận được điều này sau khi học.

  • Một dự án bộ tăng tốc mạng thần kinh (NPU) hoàn chỉnh từ đặc tả kỹ thuật đến RTL và kiểm chứng, có thể nộp cho đồ án Capstone, cuộc thi hoặc đồ án tốt nghiệp.

  • Toàn bộ quá trình từ việc cố định các hạn chế phần cứng trước, sau đó trực tiếp huấn luyện mạng thần kinh cho phù hợp, lượng tử hóa các trọng số đó thành số nguyên và triển khai lên phần cứng — không phải là việc sử dụng lại các trọng số có sẵn của người khác, mà là trải nghiệm tự mình xây dựng mọi thứ ngay từ khâu huấn luyện.

  • Khả năng kiểm chứng Bit-True trực tiếp chứng minh rằng đầu ra của phần cứng và kết quả từ Python không khác nhau dù chỉ một bit — Kỹ năng thay đổi từ "có vẻ như nó đang chạy" thành "đã chứng minh được sự trùng khớp hoàn toàn"

  • Khả năng thiết kế và triển khai trực tiếp Conv·ReLU·MaxPool·Flatten·Kết nối đầy đủ·Argmax bằng Verilog RTL (bao gồm line buffer, MAC song song, bộ tích lũy)

  • Bí quyết xử lý các cạm bẫy thực tế khi chuyển đổi trọng số dấu phẩy động đã huấn luyện sang số nguyên, chẳng hạn như chuyển đổi thứ tự trục, hiệu chỉnh chữ số và ngăn chặn tràn bộ tích lũy.

  • Kinh nghiệm tích hợp hệ thống trong việc tích hợp và kiểm chứng các khối riêng lẻ thành một chip duy nhất.

  • Bước đầu tiên trong thiết kế NPU ISA nhằm mở rộng bộ tăng tốc cố định thành bộ xử lý dựa trên tập lệnh

Xây dựng mạng thần kinh bằng chip, chứ không phải bằng phần mềm.

NPU nhận diện MNIST từ thông số kỹ thuật đến RTL và kiểm chứng — tự tay thiết kế và chứng minh đến từng bit.


Bạn đã bao giờ trăn trở về những điều này chưa?

Bạn đã thử huấn luyện mô hình nhưng không ai dạy cách đưa nó lên FPGA. Bạn đã từng làm việc với Verilog nhưng chưa bao giờ hoàn thiện toàn bộ mạng thần kinh dưới dạng một bộ tăng tốc duy nhất, và dù đã chọn chủ đề "Phần cứng AI" cho đồ án chuyên ngành hay đồ án tốt nghiệp, bạn vẫn thấy bế tắc không biết phải bắt đầu từ đâu. Khi chuyển đổi trọng số dấu phẩy động sang số nguyên, mô phỏng vẫn chạy nhưng kết quả lại bất thường, và dù đã xác nhận rằng "có vẻ như nó đang chạy" nhưng bạn lại không biết cách chứng minh liệu nó có thực sự đúng hay không.


Câu trả lời mà khóa học này mang lại

Khóa học này sẽ trực tiếp xây dựng bộ tăng tốc mạng thần kinh (NPU) nhận dạng chữ số MNIST, bắt đầu từ việc đọc thông số kỹ thuật, mô hình Golden bằng Python, huấn luyện phù hợp với các hạn chế phần cứng và lượng tử hóa số nguyên, thiết kế Verilog RTL, cho đến kiểm chứng Bit-True trên FPGA mà không bỏ qua bất kỳ bước nào.

Sau khi kết thúc khóa học, trong tay các bạn sẽ là một dự án phần cứng hoàn chỉnh có thể nộp ngay cho đồ án capstone, cuộc thi hay đồ án tốt nghiệp. Và bạn sẽ có thể tự tin nói rằng: "Tôi đã tự mình huấn luyện, thiết kế và chứng minh chính xác đến từng bit".


Bí quyết riêng của khóa học này

Thứ nhất, phần cứng trước, huấn luyện sau. Thay vì sử dụng các trọng số do người khác tạo ra, bạn sẽ cố định các ràng buộc phần cứng như độ rộng bit và thứ tự tính toán trước, sau đó trực tiếp huấn luyện mạng thần kinh sao cho phù hợp. Mô hình Python sẽ trở thành bản thiết kế chi tiết đến từng bit của RTL.

Thứ hai, thay đổi từ "có vẻ như đang hoạt động" thành "khớp chính xác". Đưa việc kiểm chứng Bit-True, chứng minh rằng mô hình Golden Python số nguyên và đầu ra RTL không khác biệt dù chỉ một bit, lên hàng đầu. Chúng tôi truyền tải nguyên vẹn những cạm bẫy trong thực tế, từ lý do tại sao dễ bị đánh lừa nếu chỉ khớp lớp (class) cho đến lý do tại sao cần kiểm chứng hàng loạt.

Thứ ba, tiến từ bộ tăng tốc sang bộ vi xử lý. Không chỉ dừng lại ở một ví dụ đơn lẻ, chúng tôi mở ra lộ trình mở rộng từ bộ tăng tốc cố định thành bộ vi xử lý được điều khiển bằng tập lệnh (NPU ISA).


Tổng quan chương trình học (7 phần · 10 bài giảng · 7 giờ 7 phút)

Phần 1. Ngôn ngữ thiết kế — Cách đọc thông số kỹ thuật MNIST NPU
Phần 2. Python — Đáp án chuẩn của phần cứng (Golden Model) và huấn luyện, lượng tử hóa số nguyên
Phần 3. Mạch trích xuất đặc trưng — Line buffer và MAC song song 4 kênh
Phần 4. Mạch chuyển đổi và quyết định — ReLU, MaxPool, Flatten, Kết nối đầy đủ và Argmax
Phần 5. Tích hợp và kiểm chứng — Chín khối trong một chip, chứng minh bằng Bit-True
Phần 6. Mở rộng — NPU ISA và trình biên dịch mini
Phần 7. Thiết lập môi trường thực hành — Kiểm tra bắt buộc trước khi mô phỏng


Đề xuất cho những đối tượng sau

Khuyên dùng cho sinh viên đại học đang chuẩn bị đồ án tốt nghiệp hoặc capstone về chủ đề phần cứng AI, những người tham gia cuộc thi cần kết quả nổi bật, các kỹ sư đang làm việc tại các công ty thiết kế muốn mở rộng năng lực sang mảng NPU và bộ tăng tốc AI, những kỹ sư phần cứng có tinh thần tự học muốn trải nghiệm thực tế việc chế tạo và chứng minh mà các sách lý thuyết chưa đáp ứng đủ, và những bạn đang chuẩn bị học cao học với định hướng nghề nghiệp về thiết kế NPU.


Kiến thức tiên quyết

Chỉ cần có kiến thức nền tảng về Verilog HDL và thiết kế logic kỹ thuật số là đủ. Với Python, bạn chỉ cần ở mức độ đọc và chạy được code, và không cần biết lý thuyết Deep Learning — các phép toán mạng thần kinh sẽ được giải thích từ đầu dưới góc độ phần cứng. Ngay cả khi bạn lần đầu sử dụng các công cụ FPGA, Phần 7 sẽ hướng dẫn bạn cách thiết lập môi trường.

Khuyến nghị cho
những người này

Khóa học này dành cho ai?

  • Kỹ sư phần cứng đang làm việc tại các công ty thiết kế và bán dẫn, muốn mở rộng năng lực sang lĩnh vực thiết kế bộ tăng tốc AI/NPU — Những người đã quen thuộc với thiết kế RTL nhưng cần kinh nghiệm trong việc hoàn thiện và kiểm chứng mạng thần kinh dưới dạng một bộ tăng tốc hoàn chỉnh.

  • Kỹ sư hướng đến sự phát triển bản thân, muốn không ngừng nâng cao năng lực ngay cả trong công việc thực tế bận rộn — Những người mong muốn các dự án thực chiến để tự tay xây dựng và chứng minh bằng Bit-True, điều mà chỉ riêng sách lý thuyết không thể đáp ứng được.

  • Sinh viên đại học chuyên ngành Điện - Điện tử - Bán dẫn đã chọn chủ đề "AI Hardware" cho đồ án tốt nghiệp/capstone nhưng đang cảm thấy bế tắc không biết làm thế nào để chuyển đổi mạng thần kinh sang RTL và triển khai lên FPGA.

  • Những người tham gia cần kết quả khác biệt trong cuộc thi — Những ai muốn thể hiện một "NPU tự thiết kế và được chứng minh bằng Bit-True" thay vì chỉ là huấn luyện mô hình

  • Sinh viên chuẩn bị học cao học muốn định hướng sự nghiệp thiết kế NPU và bộ tăng tốc AI, cần kinh nghiệm triển khai và kiểm chứng thực tế thay vì chỉ là lý thuyết.

Cần biết trước khi bắt đầu?

  • Khóa học này dành cho những người đã có kiến thức cơ bản về Verilog HDL và thiết kế logic kỹ thuật số.

  • Đối với Python, chỉ cần nắm vững ngữ pháp cơ bản ở mức có thể đọc và thực thi mã Golden Model là đủ.

  • Sẽ rất tốt nếu bạn đã từng sử dụng các công cụ mô phỏng FPGA.

Xin chào
Đây là EdgeChipLab

Xác minh sự nghiệp

Trực tiếp thiết kế và triển khai chip bán dẫn AI bằng FPGA

Với tư cách là giáo sư đại học đương nhiệm, tôi đã đúc kết 30 năm kinh nghiệm trong ngành bán dẫn hệ thống cùng bí quyết nghiên cứu và đào tạo về chip AI vào chương trình này.

Đây là chương trình đào tạo thực tiễn được thiết kế và kiểm chứng trực tiếp trên FPGA bởi giáo sư hiện đang giảng dạy kỹ thuật bán dẫn, người từng bắt đầu với vai trò nghiên cứu viên hệ thống bán dẫn tại bộ phận DS của Samsung Electronics, sau đó đảm nhiệm vị trí Giám đốc tại chi nhánh Anh và Đức, và Trưởng nhóm Tiếp thị - Kinh doanh System LSI.

Đây không đơn thuần là khóa học hướng dẫn cách sử dụng FPGA.
Khóa học hướng tới quy trình hiểu thuật toán AI → trực tiếp thiết kế NPU và CPU bằng RTL → triển khai trên FPGA → kiểm chứng trên phần cứng thực tế → và cuối cùng là mở rộng đến AI SoC.

AI Algorithm → RTL Design → FPGA Implementation → Bit-True Verification → AI SoC

 

Vượt xa lý thuyết, hướng tới hiện thực hóa phần cứng AI thực tế

Chỉ với những kiến thức rời rạc và manh mún, thật khó để đạt được năng lực thiết kế chip bán dẫn AI ở cấp độ hệ thống.

Học viên không chỉ dừng lại ở việc sử dụng các IP hộp đen đã hoàn thiện. Mục tiêu là giúp học viên từng bước trang bị năng lực thiết kế hệ thống để có thể trực tiếp thiết kế AI NPU và RISC-V CPU, tích hợp bộ nhớ và các thiết bị ngoại vi, và cuối cùng là xây dựng nên AI SoC của riêng mình.

Bắt đầu từ những kiến thức cơ bản về bóng bán dẫn và mạch kỹ thuật số, đi qua FPGA, CPU, NPU và kết nối đến tận phần cứng tăng tốc Transformer và LLM.

 

Kiểm chứng kết quả nghiên cứu bằng phần cứng FPGA thực tế.

Đây không phải là bài giảng chỉ xem bằng mắt. Không dừng lại ở lý thuyết hay mô phỏng đơn thuần, bạn sẽ trực tiếp vận hành mạch bán dẫn AI do chính mình thiết kế trên FPGA thực tế và thực hiện kiểm chứng Bit-True để kết quả RTL khớp với mô hình Python đến từng bit.

Kết quả nghiên cứu của giảng viên, bao gồm 4 bài báo đăng trên tạp chí KCI liên quan đến bán dẫn AI, FPGA và RISC-V, cũng được kết nối với nội dung đào tạo, giúp đưa các công nghệ đã được kiểm chứng trong nghiên cứu vào thiết kế thực tế và triển khai trên FPGA.

Chúng tôi công khai các mã nguồn cần thiết cho thực hành, bao gồm CPU RISC-V tự phát triển cũng như mã Python để học hình ảnh và Verilog RTL.

Nội dung được xây dựng xoay quanh bo mạch FPGA Arty S7-25 phổ thông và công cụ thiết kế Vivado miễn phí, giúp người học có thể tái hiện lại toàn bộ quá trình từ trực tiếp thiết kế, triển khai cho đến kiểm chứng.

 

Lộ trình Full-stack không gián đoạn: Từ cơ bản đến bộ tăng tốc mini LLM

Tất cả các bài giảng không phải là những mảnh ghép rời rạc, mà là một hành trình để hoàn thiện một hệ thống khổng lồ duy nhất.

  • Step 1: Lý thuyết AI và Cơ bản về xử lý hình ảnh (Bao gồm Machine Learning)

  • Step 2: Thiết kế và kiểm chứng bộ tăng tốc AI (NPU) (Bao gồm Machine Learning)

  • Step 3: Thiết kế CPU RISC-V và tích hợp hệ thống

  • Step 4: Triển khai AI SoC cao cấp và mở rộng sang nền tảng tăng tốc mini LLM (Cập nhật nội dung liên tục)

     

 

Chỉ số kiểm chứng khách quan

Tất cả các kết quả thiết kế trong khóa học này đã trải qua quá trình kiểm chứng nghiêm ngặt từ các tiêu chuẩn toàn cầu và giới học thuật.

  • Xác minh kiến trúc RISC-V: CPU RISC-V tự phát triển, vượt qua bài kiểm tra tuân thủ chính thức (ACT) của tổ chức quốc tế và công khai mã nguồn (GitHub)

  • Uy tín học thuật: 4 bài báo khoa học tác giả đơn nhiệm (Đăng trên IJIBC, tạp chí học thuật uy tín hạng A của KCI)

  • Công nhận toàn cầu: Xuất bản 2 cuốn sách kỹ thuật trên Amazon toàn cầu (đạt hạng 3 danh sách bán chạy nhất)

  • Đã xác minh hoạt động thực tế: Các IP cốt lõi như RV32I CPU, NPU, hệ thống Vision, GPS, Transformer, AURA-Edge SoC hoạt động hoàn hảo trên môi trường Arty S7

Hãy thử thách bản thân. Khi quá trình tự mình nạp code lên board và kiểm tra kết quả này kết thúc, bạn sẽ được nâng cấp thành một kỹ sư phần cứng với tầm nhìn hoàn toàn khác biệt so với trước đây.

Thêm

Chương trình giảng dạy

Tất cả

10 bài giảng ∙ (4giờ 39phút)

Ngày đăng: 
Cập nhật lần cuối: 

Đánh giá

Chưa có đủ đánh giá.
Hãy trở thành tác giả của một đánh giá giúp mọi người!

Khóa học khác của EdgeChipLab

Hãy khám phá các khóa học khác của giảng viên!

Khóa học tương tự

Khám phá các khóa học khác trong cùng lĩnh vực!