Viettel huấn luyện mô hình ai chủ quyền tiếng Việt 120 tỷ tham số, đạt hiệu suất thuộc nhóm dẫn đầu cùng quy mô

0:00 / 0:00
0:00
(Ngày Nay) - Viettel AI phát triển VT-Super-120B-A12B - mô hình ngôn ngữ lớn tiếng Việt 120 tỷ tham số, hướng tới xây dựng các hệ thống AI am hiểu sâu dữ liệu, ngôn ngữ và tri thức tiếng Việt.

Trung tâm Dịch vụ dữ liệu và Trí tuệ nhân tạo Viettel (Viettel AI) đang thúc đẩy phát triển AI chủ quyền tại Việt Nam, đồng thời ghi nhận kết quả rõ rệt về năng lực mô hình thông qua quá trình huấn luyện và tinh chỉnh trên các mô hình mở NVIDIA Nemotron.

Thông qua các bài kiểm tra, VT-Super-120B-A12B - mô hình ngôn ngữ lớn (Large Language Model - LLM) tiếng Việt do Viettel AI nghiên cứu và làm chủ đạt hiệu suất cao, nằm trong nhóm dẫn đầu về độ chính xác so với các mô hình có cùng quy mô. Đây là kết quả của việc mô hình được huấn luyện trên dữ liệu bản địa và tối ưu cho các bài toán nghiệp vụ trong nước. Đáng chú ý, VT-Super-120B-A12B tăng cường năng lực xử lý tiếng Việt mà không làm suy giảm hiệu năng tiếng Anh của mô hình gốc, đồng thời hạn chế hiện tượng quên kiến thức cũ (catastrophic forgetting) thường gặp trong quá trình huấn luyện và tinh chỉnh mô hình AI.

VT-Super-120B-A12B được xây dựng trên kiến trúc mở NVIDIA Nemotron 3 Super với quy mô 120 tỷ tham số, do đội ngũ kỹ sư Việt Nam trực tiếp huấn luyện, tinh chỉnh và tối ưu cho tiếng Việt. Khả năng xử lý ngữ cảnh dài của kiến trúc NVIDIA Nemotron cho phép mô hình duy trì mạch thông tin xuyên suốt giữa nhiều tài liệu, quy trình và hội thoại phức tạp trong cùng một tác vụ.

Viettel huấn luyện mô hình ai chủ quyền tiếng Việt 120 tỷ tham số, đạt hiệu suất thuộc nhóm dẫn đầu cùng quy mô ảnh 1
VT-Super-120B-A12B được xây dựng trên kiến trúc mở NVIDIA Nemotron 3 Super, có khả năng xử lý ngữ cảnh dài (Ảnh: NVIDIA)

Đây là năng lực đặc biệt quan trọng với các bài toán vận hành đặc thù tại Việt Nam, nơi nhiều quy định và quy trình có thể thay đổi tùy theo loại hồ sơ, đối tượng liên quan hoặc bối cảnh thực thi cụ thể. Việc sở hữu một mô hình lõi có khả năng ghi nhớ và thích ứng linh hoạt với dữ liệu thực tế tạo tiền đề để Viettel AI tinh chỉnh LLM đạt độ chính xác cao, giải quyết triệt để việc tối ưu hóa ứng dụng AI cho từng tổ chức, doanh nghiệp Việt Nam.

Bên cạnh việc kế thừa năng lực từ kiến trúc NVIDIA Nemotron 3 Super, Viettel AI cũng xây dựng quy trình huấn luyện LLM dựa trên các nguồn dữ liệu mang tính bản địa như dữ liệu hành chính, nghiệp vụ doanh nghiệp, hội thoại thực tế và hệ thống văn bản chuyên ngành tại Việt Nam. Quá trình này bao gồm nhiều giai đoạn huấn luyện; trong đó, giai đoạn tiếp tục tiền huấn luyện (continued pre-training) mở rộng năng lực ngôn ngữ và tri thức tiếng Việt trên kho dữ liệu quy mô lớn. Tiếp theo, mô hình được tinh chỉnh có giám sát (supervised fine-tuning) nhằm cải thiện khả năng suy luận, sau đó được học tăng cường (reinforcement learning) để nâng cao độ chính xác trong phản hồi và khả năng xử lý nghiệp vụ.

Ông Nguyễn Mạnh Quý, Giám đốc Viettel AI, nhận định: “AI đang chuyển từ vai trò hỗ trợ sang lớp hạ tầng công nghệ mới. Quốc gia nào làm chủ được mô hình, dữ liệu và năng lực huấn luyện sẽ có lợi thế tạo ra những hệ thống phục vụ đúng nhu cầu phát triển của mình. Với Viettel, làm chủ LLM tiếng Việt là bước đi cốt lõi để hình thành các giải pháp AI chủ quyền có khả năng đồng hành thực sự cùng các tổ chức, doanh nghiệp Việt Nam.”

Làm chủ LLM tiếng Việt là bước đi cốt lõi để hình thành các giải pháp AI chủ quyền tại Việt Nam

Shilpa Kolhatkar, Giám đốc AI Nations của NVIDIA cho biết: “Thông qua việc thúc đẩy phát triển AI chủ quyền và AI chuyên biệt theo từng lĩnh vực, Viettel đang góp phần phổ cập khả năng tiếp cận trí tuệ nhân tạo trên quy mô toàn xã hội, đồng thời chuyển hóa ngôn ngữ và dữ liệu bản địa thành những giá trị ứng dụng thực tiễn cho cơ quan chính phủ và doanh nghiệp.”

Trên nền tảng mô hình này, Viettel AI đang phát triển nền tảng AI Agent dành cho người Việt với khả năng tự thực hiện chuỗi tác vụ trong cùng một không gian làm việc. Trong đó, Trợ lý AI Pháp luật là một trong những ứng dụng đầu tiên, được kỳ vọng sẽ sở hữu khả năng hỗ trợ phân tích hồ sơ, đối chiếu quy định, tổng hợp dữ liệu và đề xuất giải pháp xử lý theo bài toán cụ thể của người dùng, với chất lượng được nâng cao đáng kể so với các phiên bản trước đây.

Từ hành chính công, chăm sóc khách hàng đến vận hành doanh nghiệp và phân tích dữ liệu, VT-Super-120B-A12B được định hướng trở thành công nghệ lõi cho các hệ thống AI hiểu và phục vụ đúng nhu cầu thực tế của tổ chức, doanh nghiệp Việt Nam.

Viettel huấn luyện mô hình ai chủ quyền tiếng Việt 120 tỷ tham số, đạt hiệu suất thuộc nhóm dẫn đầu cùng quy mô

Viettel AI phát triển VT-Super-120B-A12B - mô hình ngôn ngữ lớn tiếng Việt 120 tỷ tham số, hướng tới xây dựng các hệ thống AI am hiểu sâu dữ liệu, ngôn ngữ và tri thức tiếng Việt.

Trung tâm Dịch vụ dữ liệu và Trí tuệ nhân tạo Viettel (Viettel AI) đang thúc đẩy phát triển AI chủ quyền tại Việt Nam, đồng thời ghi nhận kết quả rõ rệt về năng lực mô hình thông qua quá trình huấn luyện và tinh chỉnh trên các mô hình mở NVIDIA Nemotron.

Thông qua các bài kiểm tra, VT-Super-120B-A12B - mô hình ngôn ngữ lớn (Large Language Model - LLM) tiếng Việt do Viettel AI nghiên cứu và làm chủ đạt hiệu suất cao, nằm trong nhóm dẫn đầu về độ chính xác so với các mô hình có cùng quy mô. Đây là kết quả của việc mô hình được huấn luyện trên dữ liệu bản địa và tối ưu cho các bài toán nghiệp vụ trong nước. Đáng chú ý, VT-Super-120B-A12B tăng cường năng lực xử lý tiếng Việt mà không làm suy giảm hiệu năng tiếng Anh của mô hình gốc, đồng thời hạn chế hiện tượng quên kiến thức cũ (catastrophic forgetting) thường gặp trong quá trình huấn luyện và tinh chỉnh mô hình AI.

VT-Super-120B-A12B được xây dựng trên kiến trúc mở NVIDIA Nemotron 3 Super với quy mô 120 tỷ tham số, do đội ngũ kỹ sư Việt Nam trực tiếp huấn luyện, tinh chỉnh và tối ưu cho tiếng Việt. Khả năng xử lý ngữ cảnh dài của kiến trúc NVIDIA Nemotron cho phép mô hình duy trì mạch thông tin xuyên suốt giữa nhiều tài liệu, quy trình và hội thoại phức tạp trong cùng một tác vụ.

Viettel huấn luyện mô hình ai chủ quyền tiếng Việt 120 tỷ tham số, đạt hiệu suất thuộc nhóm dẫn đầu cùng quy mô ảnh 2
VT-Super-120B-A12B được xây dựng trên kiến trúc mở NVIDIA Nemotron 3 Super, có khả năng xử lý ngữ cảnh dài (Ảnh: NVIDIA)

Đây là năng lực đặc biệt quan trọng với các bài toán vận hành đặc thù tại Việt Nam, nơi nhiều quy định và quy trình có thể thay đổi tùy theo loại hồ sơ, đối tượng liên quan hoặc bối cảnh thực thi cụ thể. Việc sở hữu một mô hình lõi có khả năng ghi nhớ và thích ứng linh hoạt với dữ liệu thực tế tạo tiền đề để Viettel AI tinh chỉnh LLM đạt độ chính xác cao, giải quyết triệt để việc tối ưu hóa ứng dụng AI cho từng tổ chức, doanh nghiệp Việt Nam.

Bên cạnh việc kế thừa năng lực từ kiến trúc NVIDIA Nemotron 3 Super, Viettel AI cũng xây dựng quy trình huấn luyện LLM dựa trên các nguồn dữ liệu mang tính bản địa như dữ liệu hành chính, nghiệp vụ doanh nghiệp, hội thoại thực tế và hệ thống văn bản chuyên ngành tại Việt Nam. Quá trình này bao gồm nhiều giai đoạn huấn luyện; trong đó, giai đoạn tiếp tục tiền huấn luyện (continued pre-training) mở rộng năng lực ngôn ngữ và tri thức tiếng Việt trên kho dữ liệu quy mô lớn. Tiếp theo, mô hình được tinh chỉnh có giám sát (supervised fine-tuning) nhằm cải thiện khả năng suy luận, sau đó được học tăng cường (reinforcement learning) để nâng cao độ chính xác trong phản hồi và khả năng xử lý nghiệp vụ.

Ông Nguyễn Mạnh Quý, Giám đốc Viettel AI, nhận định: “AI đang chuyển từ vai trò hỗ trợ sang lớp hạ tầng công nghệ mới. Quốc gia nào làm chủ được mô hình, dữ liệu và năng lực huấn luyện sẽ có lợi thế tạo ra những hệ thống phục vụ đúng nhu cầu phát triển của mình. Với Viettel, làm chủ LLM tiếng Việt là bước đi cốt lõi để hình thành các giải pháp AI chủ quyền có khả năng đồng hành thực sự cùng các tổ chức, doanh nghiệp Việt Nam.”

Làm chủ LLM tiếng Việt là bước đi cốt lõi để hình thành các giải pháp AI chủ quyền tại Việt Nam

Shilpa Kolhatkar, Giám đốc AI Nations của NVIDIA cho biết: “Thông qua việc thúc đẩy phát triển AI chủ quyền và AI chuyên biệt theo từng lĩnh vực, Viettel đang góp phần phổ cập khả năng tiếp cận trí tuệ nhân tạo trên quy mô toàn xã hội, đồng thời chuyển hóa ngôn ngữ và dữ liệu bản địa thành những giá trị ứng dụng thực tiễn cho cơ quan chính phủ và doanh nghiệp.”

Trên nền tảng mô hình này, Viettel AI đang phát triển nền tảng AI Agent dành cho người Việt với khả năng tự thực hiện chuỗi tác vụ trong cùng một không gian làm việc. Trong đó, Trợ lý AI Pháp luật là một trong những ứng dụng đầu tiên, được kỳ vọng sẽ sở hữu khả năng hỗ trợ phân tích hồ sơ, đối chiếu quy định, tổng hợp dữ liệu và đề xuất giải pháp xử lý theo bài toán cụ thể của người dùng, với chất lượng được nâng cao đáng kể so với các phiên bản trước đây.

Từ hành chính công, chăm sóc khách hàng đến vận hành doanh nghiệp và phân tích dữ liệu, VT-Super-120B-A12B được định hướng trở thành công nghệ lõi cho các hệ thống AI hiểu và phục vụ đúng nhu cầu thực tế của tổ chức, doanh nghiệp Việt Nam.

Bỏ quy định dành 10% số thu ngân sách từ đất đai để thực hiện đo đạc, cấp Giấy chứng nhận, xây dựng cơ sở dữ liệu đất đai
Bỏ quy định dành 10% số thu ngân sách từ đất đai để thực hiện đo đạc, cấp Giấy chứng nhận, xây dựng cơ sở dữ liệu đất đai
(Ngày Nay) - Chính phủ ban hành Nghị quyết số 161/NQ-CP về việc bãi bỏ các quy định có liên quan đến việc dành tối thiểu 10% số thu ngân sách từ đất đai để thực hiện công tác đo đạc, đăng ký đất đai, cấp Giấy chứng nhận, xây dựng cơ sở dữ liệu đất đai và đăng ký biến động, chỉnh lý hồ sơ địa chính.
Khán giả Pháp ấn tượng với diễu hành Việt phục tại thành phố Lorient
Khán giả Pháp ấn tượng với diễu hành Việt phục tại thành phố Lorient
(Ngày Nay) - Từ ngày 16 đến 19/6/2026, tại thành phố Lorient, tỉnh Morbihan, Cộng hòa Pháp, đã diễn ra Festival Vietnam lần thứ tư nhằm giới thiệu và quảng bá văn hóa Việt Nam tới công chúng Pháp và bạn bè quốc tế. Sự kiện do Hiệp hội ART SPACE, phối hợp cùng Tòa thị chính thành phố Lorient, Hiệp hội Vietnam Bretagne Sud, Hiệp hội Appel Lorient,... mang đến nhiều hoạt động giao lưu văn hóa, nghệ thuật và cộng đồng.
World Cup 2026: Mỹ nới quy định di chuyển đối với đội tuyển Iran
World Cup 2026: Mỹ nới quy định di chuyển đối với đội tuyển Iran
(Ngày Nay) - Bộ An ninh Nội địa Mỹ (DHS) đang thay đổi các quy định áp dụng đối với đội tuyển bóng đá quốc gia Iran trước trận đấu thứ 3 tại vòng bảng World Cup vào ngày 26/6 nhằm tạo điều kiện cho đội tuyển này có thêm thời gian tương tự như các quốc gia khác tham dự giải đấu. Sự thay đổi này diễn ra trong bối cảnh Liên đoàn Bóng đá Iran cho biết họ dự định gửi đơn khiếu nại chính thức lên FIFA về cách đội tuyển nước này đã bị đối xử tại Mỹ cho đến nay.
Chính quyền Mỹ đề xuất tăng mạnh lệ phí nhập quốc tịch
Chính quyền Mỹ đề xuất tăng mạnh lệ phí nhập quốc tịch
(Ngày Nay) - Bộ An ninh Nội địa Mỹ (DHS) ngày 23/6 công bố đề xuất tăng đáng kể lệ phí nhập quốc tịch và chấm dứt một số chương trình miễn, giảm phí dành cho người có thu nhập thấp, trong khuôn khổ các biện pháp của chính quyền Tổng thống Donald Trump nhằm siết chặt chính sách di trú.
Nắng nóng thúc đẩy việc thay đổi xu hướng nghỉ dưỡng tại Pháp
Nắng nóng thúc đẩy việc thay đổi xu hướng nghỉ dưỡng tại Pháp
(Ngày Nay) - Sau vài năm tăng trưởng chững lại, thị trường hồ bơi tại Pháp đang cho thấy dấu hiệu phục hồi rõ rệt trong năm 2026. Những đợt nắng nóng đến sớm cùng với sự bất ổn của tình hình quốc tế đã khiến nhiều gia đình lựa chọn đầu tư vào không gian sống tại nhà thay vì chi tiền cho các chuyến du lịch nước ngoài.