Bộ dữ liệu toán học tiếng Việt
Các bộ dữ liệu toán học tiếng Việt bao gồm các bộ đánh giá chuẩn được dịch lại, ngân hàng câu hỏi tiểu học được thu thập, kho lưu trữ kỳ thi, và các tập dữ liệu tinh chỉnh hướng dẫn lớn có nguồn gốc từ dịch máy.
Mỗi mục trình bày nội dung bài báo hoặc thẻ dữ liệu của bộ dữ liệu đó nêu rõ, đồng thời chỉ ra điểm dừng của tài liệu đó. Các tài nguyên này là lớp máy đọc được của kho tư liệu toán học Việt Nam; các đơn vị nghiên cứu lĩnh vực này được lập bản đồ riêng tại nghiên cứu toán học ở Việt Nam.
Bốn loại dữ liệu đã công bố.
Dữ liệu toán học tiếng Việt đã xuất bản rơi vào bốn loại gồm các bản dịch của các tiêu chuẩn gốc tiếng Anh, các bộ sưu tập tiểu học được thu thập từ các trang giáo dục, các bộ đánh giá bắt nguồn từ kỳ thi, và các dữ liệu hướng dẫn lớn có ít tài liệu đi kèm. Một số nỗ lực thích ứng các mục tiếng Anh đã thiết lập thông qua dịch máy hoặc dịch người, trong khi các dự án khác biên soạn câu hỏi trực tiếp từ các nền tảng giáo dục trực tuyến trong nước hoặc các bài kiểm tra học thuật chính thức. Các tập dữ liệu hướng dẫn lớn xuất hiện từ các quy trình tạo tự động hoặc các nỗ lực dịch thuật chung, thường đi kèm tài liệu thưa thớt về nguồn gốc chính xác của chúng. Một số thẻ dữ liệu hoàn toàn không có tệp README, do đó nguồn gốc và phương pháp của các bản phát hành đó không thể đọc được từ chúng.
Các bộ dữ liệu.
Thứ tự dưới đây là tùy ý. Danh sách không sắp theo thứ hạng và không đánh giá chất lượng.
-
VNHSGE (trang ngoài)
Bộ đánh giá bắt nguồn từ kỳ thi
VNHSGE được tạo ra từ Kỳ thi tốt nghiệp trung học phổ thông quốc gia Việt Nam và các bài kiểm tra tương đương.1 Nó bao gồm chín môn học và chứa hơn 19.000 câu hỏi trắc nghiệm, kèm theo 300 bài luận văn học.1 Khi đánh giá các mô hình trên bộ này, các tác giả viết rằng họ "vẫn còn không gian để phát triển, mặc dù vậy, đặc biệt là trong các lĩnh vực toán học, vật lý, hóa học và sinh học".1
-
ViMath-Bench (trang ngoài)
Bộ sưu tập cấp tiểu học
ViMath-Bench được các tác giả mô tả là "bộ dữ liệu toán học tiểu học quy mô lớn đầu tiên của Việt Nam".2 Sau khi tiền xử lý, nó chứa 8.4K mẫu, được chia thành 7.1K tập huấn luyện và 1.3K mẫu kiểm tra.2 Các mục của nó được thu thập từ ba nền tảng giáo dục trực tuyến của Việt Nam là Tailieumoi, Hamchoi và Vietjack, và các tác giả "đã nhắm cụ thể vào các câu hỏi trắc nghiệm từ lớp 3 đến lớp 5".2
-
ViMath-InstructCode (trang ngoài)
Tập tinh chỉnh hướng dẫn dựng từ ViMath-Bench
ViMath-InstructCode là một tập huấn luyện được tăng cường, riêng biệt với 14K mẫu, được sản xuất từ ViMath-Bench bằng cách sử dụng các mô hình giáo viên mạnh.2 Bộ dữ liệu mở rộng các bài toán thô đã thu thập bằng cách giới thiệu các giải pháp mã được tạo ra và các đường dẫn suy luận từng bước.2
-
stair-lab/MATH_vi (trang ngoài)
-
ura-hcmut/Vietnamese-MATH (trang ngoài)
Bản phát hành song ngữ Anh và Việt
ura-hcmut/Vietnamese-MATH là một bản phát hành song ngữ Anh và Việt với bảy tập con môn học gồm đại số 2.93k hàng, đếm và xác suất 1.25k hàng, hình học 1.35k hàng, đại số trung cấp 2.2k hàng, lý thuyết số 1.41k hàng, tiền đại số 2.08k hàng, tiền giải tích 1.29k hàng.4 Thẻ dữ liệu của nó không xác định tiêu chuẩn gốc và không mô tả phương pháp dịch thuật của nó.4
-
Các bộ hướng dẫn của 5CD-AI (trang ngoài)
Dữ liệu hướng dẫn dịch máy
Trong năm 2024, 5CD-AI đã xuất bản các bộ hướng dẫn toán học dịch bằng máy sang tiếng Việt gồm MetaMathQA ở mức 395k hàng, các bài toán đố Microsoft Orca Math ở mức 200k hàng, và NVIDIA OpenMathInstruct ở mức 50k hàng.5 Thẻ dữ liệu 395k được dán nhãn tiếng Anh và tiếng Việt và tệp README của nó trống, vì vậy không có gì về phương pháp hoặc chương trình học có thể đọc được từ đó.5
-
DHMATH/SFT_Data (trang ngoài)
-
BenchMAX_Math (trang ngoài)
-
Vi-MQA (trang ngoài)
Bộ đánh giá bắt nguồn từ kỳ thi
Vi-MQA, được xuất bản cùng với VMLU, đã thu thập các bài kiểm tra chuẩn hóa từ bảy môn học chính trong chương trình giáo dục phổ thông Việt Nam cho các cấp tiểu học, trung học cơ sở và trung học phổ thông, với các đề thi thử được lấy từ các tài liệu trực tuyến có sẵn miễn phí.8 Số lượng môn toán của nó là Toán tiểu học 200, Toán trung học cơ sở 119 và Toán trung học phổ thông 163.8
-
vi-gsm8k-agentic (trang ngoài)
Bộ tổng hợp tiếng Việt bản địa
vi-gsm8k-agentic gồm 1.465 hàng bài toán đố cấp tiểu học bằng tiếng Việt bản địa với các câu trả lời dạng số được xác minh bằng mã và các giải pháp từng bước.9 Thẻ dữ liệu của nó cho biết nó được tạo ra bởi một quy trình tự hướng dẫn theo tác nhân và không được dịch bằng máy.9
-
Vietnamese-Entrance-Exam (trang ngoài)
-
LuminarAI, toán theo sách giáo khoa (trang ngoài)
Dữ liệu hướng dẫn hướng theo sách giáo khoa
LuminarAI đã xuất bản một bản phát hành toán học hướng đến sách giáo khoa trung học cơ sở và trung học phổ thông của Việt Nam gồm 306k hàng, có thẻ dữ liệu nêu rằng nó tập trung vào các chủ đề toán học cốt lõi trong chương trình giáo dục phổ thông của Việt Nam.11 Thẻ dữ liệu không nêu việc gán nhãn chương trình cho từng mục.11
-
UIT-DODV (trang ngoài)
Bộ dữ liệu ảnh tài liệu
UIT-DODV được mô tả là bộ dữ liệu hình ảnh tài liệu tiếng Việt đầu tiên, với 2.394 hình ảnh và bốn lớp gồm Table, Figure, Caption, Formula.12 Nhiệm vụ của nó là phát hiện đối tượng, với các hộp bao và nhãn làm đầu ra, vì vậy Formula đánh dấu một vùng của trang và không phải phần toán học đã được chuyển thành văn bản.12
-
Ảnh biểu thức toán học tiếng Việt (trang ngoài)
Mức độ bám chương trình.
Tìm kiếm vào tháng 7 năm 2026, trên khắp các nguồn tiếng Anh và tiếng Việt cũng như HuggingFace, VietAlpha không tìm thấy bộ dữ liệu toán học tiếng Việt công khai nào có bài báo hoặc thẻ dữ liệu nêu rõ sự phù hợp với chương trình GDPT 2018 hoặc dán nhãn ở mức độ đơn vị chương trình. Một bộ đánh giá chuẩn được dịch kế thừa chương trình học của hệ thống mà nó xuất phát, điều này khác với chương trình toán học được giảng dạy tại các trường học ở Việt Nam. Trong đánh giá của SeaLLMs, các mô hình đạt điểm thấp hơn trên các bản dịch tiếng Việt của GSM8K và MATH so với các bản gốc tiếng Anh.14 Đối với SeaLLM-7B-v2.5, các số liệu tiếng Anh và tiếng Việt lần lượt là GSM8K 78.5 so với 72.3, và MATH 34.9 so với 30.2.14
Một số tài nguyên, bao gồm stair-lab/MATH_vi, ura-hcmut/Vietnamese-MATH, BenchMAX_Math và các bản phát hành 5CD-AI, bao gồm các bản dịch hoặc bản dịch máy của tài liệu có nguồn gốc tiếng Anh. ViMath-Bench thu thập các mục từ ba trang web giáo dục của Việt Nam và nhắm đến các lớp từ 3 đến 5. VNHSGE, Vi-MQA và Vietnamese-Entrance-Exam được rút ra từ các kỳ thi của Việt Nam. DHMATH/SFT_Data và bản phát hành LuminarAI có quy mô lớn, và các thẻ dữ liệu của chúng không mô tả cách các mục được tạo ra.
Hai trong số đó nêu mối quan hệ với chương trình giáo dục phổ thông Việt Nam theo cách chung chung. Vi-MQA nói rằng các kỳ thi của nó đến từ bảy môn học của chương trình đó, và thẻ dữ liệu LuminarAI nói rằng nó tập trung vào các chủ đề toán học cốt lõi bên trong chương trình đó. Không bên nào trong hai bên nêu rõ mục cá nhân thuộc về đơn vị nào của chương trình. Một bộ dữ liệu có thể mang ngôn ngữ tiếng Việt và có nguồn gốc Việt Nam, nhưng vẫn không mang nhãn cho biết phần nào của chương trình được dạy mà một mục kiểm tra.
Nhận dạng văn bản toán học.
Nhận dạng văn bản toán học cho tiếng Việt bao gồm việc phát hiện bố cục tài liệu và phiên âm biểu thức sau quá trình số hóa. UIT-DODV dán nhãn hình ảnh tài liệu bằng các hộp bao cho bảng, hình vẽ, chú thích và công thức, nhưng không phiên âm các ký hiệu toán học bên trong các vùng đó.12 Một bộ dữ liệu riêng biệt cung cấp 6.000 hình ảnh được chụp bằng máy ảnh với thông tin vị trí và chuỗi LaTeX để đánh giá các thuật toán nhận dạng.13 Một khảo sát năm 2025 về phân tích và nhận dạng tài liệu tiếng Việt nêu rằng "có sự thiếu hụt đáng chú ý về các bộ dữ liệu được chú thích quy mô lớn cho hình ảnh tài liệu tiếng Việt" và điều này giới hạn sự phát triển và tinh chỉnh các mô hình cho nhận dạng ký tự quang học tiếng Việt.15 Phạm vi được nêu của nó là phân tích tài liệu tiếng Việt nói chung, và nó không phải là một khảo sát về nhận dạng biểu thức toán học.15 Các công cụ chung như Nougat chuyển đổi các tài liệu khoa học sang mã đánh dấu để giải quyết sự mất mát thông tin ngữ nghĩa trong PDF "đặc biệt đối với các biểu thức toán học".16 Các công cụ khác như pix2tex lấy hình ảnh của một công thức toán học và trả về mã LaTeX tương ứng, và tài liệu riêng của nó bảo người dùng phải "Luôn kiểm tra kỹ lưỡng kết quả".17
Phòng nghiên cứu này dựng dữ liệu ra sao.
Phòng nghiên cứu công bố công việc về bộ dữ liệu theo từng đợt. Trong đợt làm việc đầu tiên, một hợp đồng lược đồ nghiêm ngặt đã giải quyết tình trạng nhiễm chéo giữa ranh giới câu hỏi và lời giải, đồng thời xác nhận rằng việc bóc tách cú pháp các PDF toán học tiếng Việt là khả thi. Đợt thứ hai là một nghiên cứu tính khả thi về việc liệu các bản ghi toán học tiếng Việt có cấu trúc có thể được tạo ra từ các PDF thô thông qua việc trích xuất trên phần cứng cục bộ.
Trong đợt thứ ba, Code-Flow-v1 là nguyên mẫu đầu cuối đầu tiên và nó kết nối việc trích xuất PDF, chuyển đổi Markdown, cấu trúc hóa JSON và xác thực. Cadmus chuyển đổi tài liệu nguồn toán học tiếng Việt thành các bản ghi có cấu trúc, được xác minh và được gán nhãn chương trình thông qua một quy trình sản xuất mười một giai đoạn có thể tiếp tục và có thể kiểm toán.
Việc chuẩn hóa tài liệu trước khi phân đoạn làm hỏng các token toán học, và một giai đoạn chuẩn hóa và phân đoạn hai góc nhìn đã được xây dựng để ngăn chặn điều đó. Kiến trúc hai góc nhìn nhúng một góc nhìn đã chuẩn hóa trong lúc lắp ráp đầu ra từ văn bản gốc, và nó bảo toàn 100% các token toán học, so với 0,03% của cơ sở chỉ chuẩn hóa. Một bộ chỉnh sửa hậu OCR ưu tiên độ chính xác dành cho đáp án toán học tiếng Việt mang tính xác định và ít tốn tài nguyên, và nó đạt độ chính xác 99,913% trên 2.288 lần chỉnh sửa tự động, với không có lỗi thảm khốc và không có sự thay đổi tệp nguồn.
Một ghi chú riêng biệt giải thích cách mạng nơ-ron liên quan đến văn bản toán học tiếng Việt và đi qua quá trình lan truyền tiến, các Jacobian của lớp, lan truyền ngược và bài kiểm tra bậc hai.
Theo lời của chính mình, VietAlpha đã xây dựng bộ dữ liệu toán học phù hợp chương trình đầu tiên theo các tiêu chuẩn của Bộ Giáo dục và Đào tạo Việt Nam.
-
Kho tư liệu toán học Việt Nam
Những văn bản nào còn lại, được lưu ở đâu, và việc số hóa đã đi đến đâu.
-
Chương trình môn Toán GDPT 2018
Chương trình được tổ chức ra sao và học sinh phải trả giá nào để theo được.
-
Giới thiệu Cadmus
Quy trình VietAlpha dùng để đưa tài liệu toán học tiếng Việt thành bản ghi có cấu trúc.
Nguồn.
-
Nguồn gốc của bộ dữ liệu từ kỳ thi tốt nghiệp, chín môn học, con số hơn 19.000 câu hỏi trắc nghiệm và 300 bài luận văn học, cùng nhận định được dẫn của nhóm tác giả về kết quả của các mô hình.
-
Mô tả ViMath-Bench là bộ dữ liệu toán tiểu học quy mô lớn đầu tiên của Việt Nam, 8.4K mẫu chia 7.1K và 1.3K, ba nền tảng nguồn và khoảng lớp, cùng ViMath-InstructCode là tập tăng cường riêng gồm 14K mẫu.
-
Thẻ dữ liệu HuggingFace, stair-lab/MATH_vi
Phát biểu của thẻ dữ liệu rằng đây là bản dịch tiếng Việt, việc đặt tên lighteval/MATH là phiên bản gốc, và liên kết tới mã nguồn dịch.
-
Thẻ dữ liệu HuggingFace, ura-hcmut/Vietnamese-MATH
Bảy tập con môn học và số hàng của từng tập, cùng việc thẻ dữ liệu không nêu bộ đánh giá chuẩn gốc và không mô tả phương pháp dịch.
-
HuggingFace, các bộ hướng dẫn toán học tiếng Việt của 5CD-AI
Ba bản phát hành năm 2024 và số hàng của chúng, cùng tệp README trống trên thẻ dữ liệu 395k.
-
Con số 168k hàng, tập con tiểu học 29.5k hàng, và tệp README trống.
-
HuggingFace, LLaMAX/BenchMAX_Math
Việc lấy nguồn từ MGSM, mở rộng sang sáu ngôn ngữ khác gồm tiếng Việt, và mô tả được dẫn về phương pháp dịch và chỉnh sửa hậu kỳ.
-
Việc thu thập bài kiểm tra chuẩn hóa thuộc bảy môn học và ba cấp học, việc dùng đề thi thử trực tuyến miễn phí, và ba con số môn toán.
-
HuggingFace, vuongtsc/vi-gsm8k-agentic
Con số 1.465 hàng, câu trả lời dạng số được xác minh bằng mã và lời giải từng bước, cùng phát biểu của thẻ dữ liệu rằng bộ này do một quy trình tự hướng dẫn theo tác nhân tạo ra và không phải dịch máy.
-
HuggingFace, Intelligent-Internet/Vietnamese-Entrance-Exam
Con số 432 bài tập, 243 bài thuộc môn toán, và phát biểu của thẻ dữ liệu rằng các bài gốc tiếng Việt đã được dịch sang tiếng Anh.
-
HuggingFace, LuminarAI/vietnamese-ms-hs-textbook-math-300K
Con số 306k hàng và phát biểu của thẻ dữ liệu về việc tập trung vào các chủ đề toán học cốt lõi trong chương trình giáo dục phổ thông của Việt Nam, không nêu việc gán nhãn chương trình cho từng mục.
-
Parsing Digitized Vietnamese Paper Documents (UIT-DODV)
Mô tả UIT-DODV là bộ dữ liệu ảnh tài liệu tiếng Việt đầu tiên, 2.394 hình ảnh và bốn lớp, cùng phát biểu rằng nhiệm vụ là phát hiện đối tượng với hộp bao và nhãn làm đầu ra.
-
Mendeley Data, ảnh tài liệu tiếng Việt chụp bằng máy ảnh có chứa biểu thức toán học
Con số 6.000 hình ảnh, và việc cung cấp cả thông tin vị trí lẫn chuỗi LaTeX cho các biểu thức toán học, phục vụ đánh giá thuật toán nhận dạng.
-
SeaLLMs, ACL 2024 system demonstrations
So sánh điểm GSM8K và MATH trên bản gốc tiếng Anh và bản dịch tiếng Việt, cùng các số liệu của SeaLLM-7B-v2.5 được dẫn ở trên.
-
A Survey on Vietnamese Document Analysis and Recognition (arXiv:2506.05061)
Phát biểu được dẫn về sự thiếu hụt các bộ dữ liệu được chú thích quy mô lớn cho hình ảnh tài liệu tiếng Việt, và phạm vi mà chính khảo sát nêu ra.
-
Nougat: Neural Optical Understanding for Academic Documents (arXiv:2308.13418)
Mô tả về sự mất mát thông tin ngữ nghĩa trong PDF, đặc biệt với các biểu thức toán học, và việc chuyển tài liệu khoa học sang mã đánh dấu.
-
Mô tả công cụ nhận ảnh một công thức toán học và trả về mã LaTeX tương ứng, cùng chỉ dẫn của chính công cụ về việc kiểm tra kỹ kết quả.
Không có thẻ dữ liệu hoặc bài báo đã xuất bản nào mà chúng tôi tìm thấy nêu rõ một mục thuộc phần nào của chương trình học Việt Nam.