"Tôi đã sử dụng API embedding của OpenAI" và "Tôi đã tự mình triển khai một mô hình Transformer gồm 820 nghìn tham số mà không dùng framework" là hai câu hoàn toàn khác nhau. Nếu muốn viết câu phía sau, bạn phải mở ra và tìm hiểu bên trong, và khóa học này chính là quá trình đó.
Tôi viết trong CV như thế này.
01
Triển khai bằng TypeScript một mô hình ngôn ngữ Transformer quy mô 820.000 tham số mà không cần framework deep learning
Tự viết toàn bộ từ thiết kế cấu trúc self-attention đến huấn luyện và sinh câu, rồi huấn luyện mô hình bằng các kịch bản của Shakespeare
02
Tự triển khai vi phân tự động và lan truyền ngược, tái hiện thủ công các phép tính vốn được framework thực hiện thay
Tạo ra các thành phần tính toán cần điều chỉnh giá trị nào và điều chỉnh bao nhiêu, rồi dùng chúng để huấn luyện một mạng nơ-ron nhỏ và xác nhận rằng hàm mất mát giảm xuống
03
Huấn luyện Word2Vec skip-gram từ đầu và xác minh sự hình thành các cụm ngữ nghĩa bằng độ tương đồng cosine
Không đưa ra bất kỳ quy tắc nào mà chỉ yêu cầu "hãy thử đoán các từ xung quanh", vậy mà mèo·chó đạt 0.697, còn mèo·thị trường chứng khoán là 0.432
04
Tự xây dựng tokenizer BPE và hoàn thiện quy trình từ đầu đến embedding cấp câu
Từ quy tắc chia văn bản dài thành những mảnh mà mô hình có thể xử lý, cho đến việc chuyển cả một câu thành các con số
05
So sánh mô hình tự xây dựng và mô hình công khai theo cùng một tiêu chí, đồng thời tổng hợp sự khác biệt về hiệu năng bằng số liệu
Bạn có thể giải thích bằng những căn cứ cụ thể rằng chúng khác nhau ở điểm nào, khác biệt bao nhiêu và sự khác biệt đó bắt nguồn từ đâu
06
Chẩn đoán nguyên nhân khi kết quả embedding bất thường bằng cách phân tách theo lượng học và số chiều
Bạn có thể phán đoán nên kiểm tra ở đâu trước với tư cách là người hiểu rõ bên trong, chứ không chỉ là người gọi API
Cả sáu dòng đều là những thứ bạn trực tiếp xây dựng và trực tiếp đo lường trong khóa học này. Ngay cả khi trong buổi phỏng vấn có câu hỏi "Vậy bên trong đang diễn ra chuyện gì?", bạn vẫn còn điều để trả lời.