Hai năm gần đây, năng lực dịch máy đã dịch chuyển từ máy chủ về thẳng ổ cứng: một gói vài gigabyte chuyển ngữ được hợp đồng, hồ sơ bệnh án, tài liệu nội bộ mà không đẩy ký tự nào ra ngoài. Nghịch lý là phần cứng phổ thông đi chậm hơn phần mềm. Dịch thuật ngoại tuyến buộc nạp trọn bộ trọng số vào bộ nhớ, trong khi cấu hình 16GB vẫn là ngưỡng phổ biến nhất tại Việt Nam. Bài viết đối chiếu dung lượng thật từng gói theo tài liệu hãng, tính phần bộ nhớ còn trống sau khi hệ điều hành lấy phần, rồi xác định ngưỡng mà 16GB hết đường.
Vì sao dịch thuật ngoại tuyến trở thành nhu cầu thực tế
Điểm mấu chốt không phải tốc độ, mà là quyền kiểm soát văn bản. Mọi dịch vụ chuyển ngữ trên đám mây đều đòi hỏi gửi nguyên văn bản gốc qua đường truyền tới hạ tầng của nhà cung cấp. Với hợp đồng thương mại, bản khai thuế, biên bản họp hội đồng hay dữ liệu khách hàng, hành vi đó tự thân là một rủi ro pháp lý. Dịch thuật ngoại tuyến đảo ngược nguyên lý: bộ trọng số nằm sẵn trên ổ, quá trình suy luận diễn ra trong bộ nhớ máy, không gói tin nào rời khỏi thiết bị. Đường truyền chỉ cần dùng đúng một lần, lúc tải gói về.

Lợi thế thứ hai mang tính vận hành. Một mô hình ngôn ngữ chạy cục bộ không có hạn mức truy vấn, không tính tiền theo token và không hỏng việc khi mạng chập chờn. Tài liệu Ollama xác nhận công cụ này giữ mô hình trong bộ nhớ 5 phút sau lần gọi cuối rồi tự giải phóng, còn tham số keep_alive cho phép giữ thường trú vô hạn. Cơ chế đó phù hợp với nhịp làm việc theo lô của dịch thuật ngoại tuyến: nạp một lần, xử lý hàng trăm đoạn, không phải chờ khởi tạo lại.
Cái giá phải trả nằm ở phần cứng. Đám mây che giấu toàn bộ yêu cầu bộ nhớ, còn một laptop 16GB RAM thì phơi ra hết. Nền tảng kỹ thuật của việc vận hành mô hình trên máy cá nhân đã được phân tích riêng trong bài Ollama trên laptop: Vận hành AI cục bộ không cần đám mây, nên phần dưới đi đúng một trục hẹp: gói dịch nào vừa 16GB, chất lượng chuyển ngữ Việt Anh tới đâu, và ngưỡng nào thì dung lượng đó thiếu hụt.
Dung lượng thật của các mô hình ngôn ngữ dịch chuyên biệt
Năm 2026 mở ra lựa chọn khác hẳn thời các mô hình đa dụng phải kiêm nhiệm việc dịch. Ngày 15/01/2026, Google công bố TranslateGemma: A new family of open translation models, một họ mô hình ngôn ngữ dịch mở dựng trên nền Gemma 3, phát hành ở ba kích cỡ 4B, 12B và 27B tham số, phục vụ 55 ngôn ngữ cùng gần 500 cặp ngôn ngữ bổ sung dành cho nghiên cứu. Tiếng Việt nằm trong danh sách hỗ trợ, ghi rõ hai mã vi và vi-VN.

Con số dung lượng mới là phần quyết định cho dịch thuật ngoại tuyến. Thư viện chính chủ Ollama library translategemma ghi rõ ba thẻ: bản 4b nặng 3,3GB với 4,3 tỷ tham số, bản 12b nặng 8,1GB với 12,2 tỷ tham số, bản 27b nặng 17GB với 27,4 tỷ tham số. Cả ba lượng tử hóa Q4_K_M và khai báo cửa sổ ngữ cảnh 128K. Đối chiếu với một laptop 16GB RAM, bản 27b vượt ngưỡng ngay ở dung lượng tệp, còn bản 12b chiếm hơn nửa tổng bộ nhớ.
Một giới hạn ít ai để ý được ghi trong thẻ mô hình trên Hugging Face: TranslateGemma nhận tổng ngữ cảnh đầu vào 2K token, thấp hơn nhiều cửa sổ 128K mà thẻ Ollama khai báo. Nghĩa là tài liệu dài phải cắt thành đoạn nhỏ, và kỳ vọng dán trọn một hợp đồng ba mươi trang vào một lượt đều sai. Ở nhóm mô hình ngôn ngữ dịch cũ hơn, trang No Language Left Behind của Meta giới thiệu NLLB-200 phủ 200 ngôn ngữ, cải thiện 44% điểm BLEU so với mô hình tốt nhất trước đó, kèm bộ đánh giá FLORES-200 do người dịch thủ công.
Ngưỡng RAM khả dụng trên laptop 16GB RAM khi nạp mô hình
Dung lượng tệp không đồng nghĩa với bộ nhớ tiêu tốn. Trên blog lập trình viên, Google công bố mức bộ nhớ của họ Gemma 3 khi lượng tử hóa: bản 27B giảm từ 54GB ở định dạng BF16 xuống 14,1GB ở int4, bản 12B từ 24GB xuống 6,6GB, bản 4B từ 8GB xuống 2,6GB. Hãng nhấn mạnh đây là dung lượng riêng bộ trọng số, chưa tính bộ đệm KV phát sinh lúc suy luận. Các mức này áp cho TranslateGemma vì họ mô hình dịch đó dựng trên nền Gemma 3, không phải vì thiếu lựa chọn mới hơn. Với một laptop 16GB RAM, mốc 6,6GB của bản 12B là con số cần nhớ.

Phần bộ nhớ thực sự khả dụng cho dịch thuật ngoại tuyến còn phụ thuộc cấu hình phần mềm. Tài liệu Ollama cho biết cửa sổ ngữ cảnh mặc định là 4096 token, và lượng bộ nhớ cần thiết tăng theo tích của hai biến OLLAMA_NUM_PARALLEL với OLLAMA_CONTEXT_LENGTH. Cùng tài liệu nêu ba mức lượng tử hóa bộ đệm KV: f16 mặc định, q8_0 tiết kiệm khoảng một nửa, q4_0 tiết kiệm khoảng ba phần tư. Khi bộ nhớ thiếu hụt, yêu cầu mới bị đưa vào hàng chờ thay vì thất bại, nên biểu hiện thường thấy là độ trễ tăng vọt.
Tài liệu yêu cầu hệ thống của LM Studio đặt ngưỡng khuyến nghị đúng ở 16GB cho cả Windows và macOS, kèm gợi ý tối thiểu 4GB VRAM riêng trên nền Windows và bắt buộc tập lệnh AVX2 với x64. Nói cách khác, một laptop 16GB RAM đang nằm ngay sàn khuyến nghị của chính nhà phát triển công cụ, không có biên độ dư dả. Tương quan giữa bộ nhớ hệ thống và VRAM cho từng cỡ mô hình ngôn ngữ đã được đo riêng trong bài Local LLM: Cấu hình RAM và VRAM cho model 7B đến 70B.
Chất lượng dịch Việt Anh theo số liệu hãng công bố
Thẻ mô hình TranslateGemma trên Hugging Face công bố kết quả trên bộ WMT24++ tính trung bình 55 ngôn ngữ, dùng hai thước đo MetricX và COMET. Bản 4B đạt MetricX 5,32 và COMET 81,6. Bản 12B đạt MetricX 3,60 và COMET 83,5. Bản 27B đạt MetricX 3,09 và COMET 84,4. Với MetricX, số càng thấp càng tốt; với COMET thì ngược lại. Cần lưu ý: đây là mức trung bình 55 ngôn ngữ, không phải điểm riêng cho cặp Việt Anh.

Google đưa thêm hai nhận định trong bài công bố, cả hai là tuyên bố của hãng chứ không phải kiểm định độc lập: bản 12B vượt mức nền của Gemma 3 27B dù dùng chưa tới một nửa số tham số, còn bản 4B ngang ngửa mức nền của bản 12B. Về triển khai, hãng xếp bản 4B cho thiết bị di động và biên, bản 12B cho laptop phổ thông, còn bản 27B cho một GPU H100 đơn hoặc TPU trên đám mây. Cách phân loại này khớp với các con số dung lượng ở phần trên.
Chưa nguồn chính chủ nào công bố điểm riêng cho cặp Việt Anh, nên mọi phát biểu kiểu mô hình ngôn ngữ này dịch tiếng Việt hay hơn mô hình kia đều thiếu căn cứ. Phương án xác minh khả thi cho dịch thuật ngoại tuyến là tự dựng bộ mẫu vài chục đoạn thuộc đúng loại văn bản cần dùng, chạy qua từng thẻ rồi tự đối chiếu. Cách thiết lập phép thử và so sánh hai công cụ chạy cục bộ được trình bày trong bài LM Studio hay Ollama chạy AI cục bộ tốt hơn?.
Thao tác triển khai dịch thuật ngoại tuyến bằng Ollama
Quy trình gọn hơn hình dung ban đầu. Sau khi cài Ollama, một lệnh pull duy nhất tải thẻ cần dùng về ổ, và từ lần thứ hai trở đi toàn bộ tác vụ dịch thuật ngoại tuyến diễn ra không cần mạng. Chọn thẻ nên bắt đầu từ dung lượng: đối chiếu con số hãng công bố với bộ nhớ còn trống sau khi hệ điều hành và trình duyệt đã lấy phần. Bảng dưới tổng hợp các thẻ liên quan theo đúng số ghi trên thư viện Ollama, gồm hai họ đa dụng Qwen3.5 và Gemma 4, là các họ mới nhất còn có thẻ vừa 16GB.
| Thẻ mô hình | Tham số | Lượng tử hóa | Dung lượng tải | Cửa sổ ngữ cảnh |
|---|---|---|---|---|
| translategemma 4b | 4,3 tỷ | Q4_K_M | 3,3GB | 128K |
| translategemma 12b | 12,2 tỷ | Q4_K_M | 8,1GB | 128K |
| translategemma 27b | 27,4 tỷ | Q4_K_M | 17GB | 128K |
| qwen3 4b | 4,02 tỷ | Q4_K_M | 2,5GB | 256K |
| qwen3.5 4b | 4,66 tỷ | Q4_K_M | 3,4GB | 256K |
| qwen3.5 9b | 9,65 tỷ | Q4_K_M | 6,6GB | 256K |
| gemma4 12b | 11,9 tỷ | Q4_K_M | 7,6GB | 256K |
Hai tham số cần chỉnh trước khi chạy thật. Thứ nhất là OLLAMA_CONTEXT_LENGTH: giữ mức mặc định 4096 token đủ cho từng đoạn văn và tiết kiệm bộ nhớ hơn hẳn việc nới lên hàng trăm nghìn token. Thứ hai là keep_alive, đặt giá trị âm để giữ mô hình thường trú khi cần xử lý một tập tài liệu lớn liên tục. Riêng với họ TranslateGemma, giới hạn 2K token đầu vào buộc phải chia tài liệu theo đoạn hoặc theo câu, và nên chia theo ranh giới ngữ nghĩa thay vì cắt cứng theo số ký tự.
Phương án thứ hai là LM Studio, phù hợp với ai không quen dòng lệnh. Tài liệu yêu cầu hệ thống nêu macOS 14.0 trở lên với chip Apple Silicon M1 đến M4, Ubuntu 20.04 trở lên ở bản AppImage, và mức khuyến nghị 16GB bộ nhớ. Cùng tài liệu ghi bản 8GB vẫn khả dụng với các mô hình ngôn ngữ nhỏ, điều đó đúng với thẻ 4b nặng 3,3GB nhưng hết đúng khi bước lên thẻ 12b.
Khi nào laptop 16GB RAM không còn đáp ứng được
Có ba tình huống một laptop 16GB RAM bộc lộ giới hạn. Thẻ 27b nặng 17GB vượt ngưỡng ngay ở dung lượng tệp; thẻ nhỏ nhất của Llama 4 trên thư viện Ollama nặng 67GB, ngoài tầm hoàn toàn. Thẻ 12b nặng 8,1GB thì nạp được, nhưng khi nới cửa sổ ngữ cảnh hoặc chạy song song nhiều yêu cầu, bộ đệm KV cộng thêm sẽ ăn vào phần bộ nhớ hệ điều hành đang giữ. Tình huống thứ ba là vừa dịch thuật ngoại tuyến vừa mở trình duyệt hàng chục thẻ cùng bộ ứng dụng văn phòng.
| Mẫu máy | RAM cấu hình kho | Kiến trúc bộ nhớ theo PSREF | Giá kho ngày 10/09 |
|---|---|---|---|
| Lenovo ThinkBook 14 G8 IRL (2025) | 16GB | Hai khe DDR5 SODIMM, tối đa 64GB | tầm 24 – 26 triệu |
| Lenovo IdeaPad Pro 5 16AKP10 (2025) | 16GB LPDDR5X-8000 | Hàn lên bo mạch, không khe cắm | tầm 33,5 triệu |
| Lenovo Yoga 7 2-in-1 14IPH11 (2026) bản 16GB | 16GB LPDDR5X-7467 | Hàn lên bo mạch, không khe cắm | tầm 38 triệu |
| Lenovo Yoga 7 2-in-1 14IPH11 (2026) bản 32GB | 32GB LPDDR5X-7467 | Hàn lên bo mạch, không khe cắm | tầm 54 – 55 triệu |
| Lenovo Legion 5 15IPH11 (2026) | 16GB, một thanh, còn một khe | Hai khe DDR5 SODIMM, tối đa 32GB | tầm 57 triệu |
Kiến trúc bộ nhớ quyết định đường lùi. Tài liệu PSREF của Lenovo ghi ThinkBook 14 G8 IRL có hai khe DDR5 SODIMM chạy được kênh đôi và chấp nhận tối đa 64GB, còn Legion 5 15IPH11 cũng hai khe SODIMM nhưng chỉ tới 32GB DDR5-5600. Ngược lại, IdeaPad Pro 5 16AKP10 và Yoga 7 2-in-1 14IPH11 đều được PSREF ghi bộ nhớ hàn thẳng lên bo mạch, không có khe nào, nghĩa là con số mua lúc đầu là con số dùng suốt vòng đời.
Chênh lệch giá bộc lộ rõ nhất ở cùng một mẫu. Trên Yoga 7 2-in-1 14IPH11, bản 16GB kèm ổ 512GB có giá kho ngày 10/09 quanh 38 triệu, còn bản 32GB kèm ổ 1TB nhảy lên khoảng 54 – 55 triệu. Khoản chênh mười mấy triệu đó phải trả một lần và trả trước, vì bộ nhớ hàn không cho nâng sau. Với nhu cầu dừng ở thẻ 4b hoặc 12b, một laptop 16GB RAM có khe SODIMM là phương án hợp lý hơn cho dịch thuật ngoại tuyến: mua cấu hình gốc rẻ, cộng thêm một thanh khi khối lượng dịch tăng.
Những câu hỏi thường gặp về dịch thuật ngoại tuyến
Laptop 16GB RAM chạy được thẻ TranslateGemma nào?
Thẻ 4b nặng 3,3GB và thẻ 12b nặng 8,1GB đều nằm trong tầm của một laptop 16GB RAM, theo dung lượng ghi trên thư viện Ollama. Thẻ 27b nặng 17GB thì không, vì riêng tệp đã vượt tổng bộ nhớ. Ở cấu hình này, thẻ 12b nên chạy tại cửa sổ ngữ cảnh mặc định 4096 token và một luồng song song để tránh phần bộ đệm KV phình ra.
Dịch thuật ngoại tuyến có cần card đồ họa rời hay không?
Không bắt buộc. Tài liệu yêu cầu hệ thống của LM Studio chỉ khuyến nghị tối thiểu 4GB VRAM riêng trên nền Windows, kèm điều kiện bắt buộc là tập lệnh AVX2 với bộ xử lý x64. Tài liệu Ollama nêu nguyên tắc nạp: nếu mô hình vừa trọn một GPU thì nạp hết vào GPU đó, còn không thì chia tải, nên laptop chỉ có đồ họa tích hợp vẫn vận hành được bằng bộ nhớ hệ thống.
Vì sao tài liệu dài không dán trọn vào một lượt dịch?
Thẻ mô hình TranslateGemma trên Hugging Face ghi tổng ngữ cảnh đầu vào là 2K token, thấp hơn nhiều con số 128K mà thẻ Ollama khai báo cho cửa sổ ngữ cảnh. Ràng buộc này thuộc về chính bộ trọng số của mô hình, không phải giới hạn phần cứng, nên nâng RAM cũng không gỡ được. Cách xử lý là cắt tài liệu theo đoạn hoặc theo câu rồi ghép kết quả lại.
Mô hình ngôn ngữ nào dịch Việt Anh chính xác nhất hiện nay?
Chưa nguồn chính chủ nào công bố điểm riêng cho cặp Việt Anh. Số liệu khả dụng của TranslateGemma trên bộ WMT24++ là mức trung bình của 55 ngôn ngữ: bản 4B đạt MetricX 5,32 và COMET 81,6, bản 12B đạt 3,60 và 83,5, bản 27B đạt 3,09 và 84,4. Muốn kết luận cho tiếng Việt thì phải tự dựng bộ mẫu theo đúng loại văn bản cần chuyển ngữ rồi đối chiếu bằng dịch thuật ngoại tuyến trên máy.





0 phản hồi cho “Chạy mô hình ngôn ngữ dịch thuật ngoại tuyến: Laptop 16GB RAM có gánh nổi?”