Dữ liệu Ngữ âm Tiếng Mường: Từ Công trình Ngôn ngữ Học đến Nguồn tư liệu Số mở

Tiếng Mường không chỉ là phương tiện giao tiếp của cộng đồng người Mường mà còn là một nguồn tư liệu đặc biệt quan trọng đối với việc nghiên cứu lịch sử và sự đa dạng của các ngôn ngữ Việt–Mường. Tuy nhiên, tiếng Mường không hoàn toàn đồng nhất giữa các địa phương. Mỗi vùng cư trú có thể lưu giữ những cách phát âm, thanh điệu và vốn từ mang sắc thái riêng. Việc tập hợp, hệ thống hóa và so sánh những khác biệt ấy vì thế có ý nghĩa lớn đối với ngôn ngữ học cũng như công tác bảo tồn di sản văn hóa.
Nhằm đưa nguồn tư liệu quý này đến gần hơn với giới nghiên cứu và công chúng, nhóm Digitizing Việt Nam đã xây dựng bộ dữ liệu trực tuyến “Dữ liệu ngữ âm tiếng Mường”, dựa trên công trình Ngữ âm tiếng Mường qua các phương ngôn của nhà ngôn ngữ học Nguyễn Văn Tài. Cuốn sách được Nhà xuất bản Từ điển Bách khoa xuất bản tại Hà Nội năm 2005, gồm 350 trang và có kèm bản đồ. Nội dung công trình khảo sát ngữ âm tiếng Mường qua nhiều thổ ngữ, đồng thời thảo luận về vấn đề xây dựng một hệ thống phiên âm phù hợp cho ngôn ngữ này.
Một kho từ vựng so sánh có quy mô đáng chú ý
Trọng tâm của bộ dữ liệu là bảng từ vựng so sánh gồm 941 mục từ tiếng Việt, tương ứng với cách biểu đạt trong 30 thổ ngữ tiếng Mường. Các thổ ngữ được ghi nhận trải rộng từ Mường Thải, Tân Phong, Huy Thượng, Giáp Lai, Yến Mao, Mường Bi, Mường Khói, Mường Thàng và Mường Động đến Mường Ống, Mường Rặc, Nghĩa Mai, Sông Con, Lâm La và Cổ Liêm — tiếng Nguồn.
Với mỗi mục từ như “ác”, “ai”, “anh”, “ao”, “áo” hay “ăn”, người dùng có thể quan sát cách phát âm tương ứng ở từng địa phương. Các dạng từ được trình bày bằng ký hiệu phiên âm, đi kèm chữ số thể hiện thanh điệu. Nhờ đặt dữ liệu của 30 thổ ngữ cạnh nhau, giao diện giúp người đọc nhanh chóng nhận ra những điểm tương đồng và khác biệt về phụ âm, nguyên âm, cấu trúc âm tiết và hệ thống thanh điệu.
Chẳng hạn, cùng một mục từ tiếng Việt có thể được phát âm gần giống nhau tại một số vùng nhưng lại có hình thức khá khác biệt ở những vùng khác. Những biến thể này không đơn thuần là sự khác nhau trong cách nói. Chúng còn phản ánh lịch sử phát triển của ngôn ngữ, quá trình tiếp xúc giữa các cộng đồng và đặc điểm phân bố địa lý của từng nhóm cư dân.
Từ trang sách đến dữ liệu có thể tra cứu
Giá trị nổi bật của dự án nằm ở việc chuyển một khối tư liệu chuyên môn từ hình thức sách in sang cấu trúc dữ liệu số. Thay vì phải dò tìm thủ công trong hàng trăm trang sách, người dùng có thể nhập một từ tiếng Việt vào ô tìm kiếm và đối chiếu cách phát âm của từ đó trong toàn bộ 30 thổ ngữ.
Cách tổ chức này mở rộng đáng kể khả năng sử dụng công trình của Nguyễn Văn Tài. Các nhà ngôn ngữ học có thể khai thác dữ liệu để nghiên cứu phương ngữ học, ngữ âm học, ngôn ngữ học lịch sử và quan hệ giữa tiếng Việt với tiếng Mường. Giảng viên và sinh viên có thể sử dụng bảng dữ liệu làm tư liệu trực quan trong các bài học về biến thể ngôn ngữ. Người Mường và những độc giả quan tâm cũng có thể tìm hiểu sự phong phú trong tiếng nói của từng địa phương.
Bộ dữ liệu được xác định là tài nguyên số bằng tiếng Mường và tiếng Việt, thuộc các chủ đề ngôn ngữ học và các dân tộc Việt Nam. Tài nguyên được mở cho mục đích giáo dục và nghiên cứu, nhưng không cho phép sử dụng thương mại.
Bảo tồn sự đa dạng của tiếng Mường trong môi trường số
Trong bối cảnh nhiều ngôn ngữ và phương ngữ thiểu số đang chịu sức ép từ quá trình đô thị hóa, di cư và sự phổ biến của các ngôn ngữ có số người sử dụng lớn, việc số hóa tư liệu tiếng Mường mang ý nghĩa vượt ra ngoài phạm vi một dự án học thuật. Mỗi hình thức phát âm được ghi lại là một dấu vết của ký ức cộng đồng và của môi trường văn hóa nơi ngôn ngữ ấy được hình thành, lưu truyền.
Bộ dữ liệu không thể thay thế tiếng nói sống động của người bản ngữ, cũng không bao quát toàn bộ đời sống ngôn ngữ của các cộng đồng Mường. Tuy vậy, đây là một nền tảng tham khảo quan trọng. Khi được kết hợp với tư liệu âm thanh, nghiên cứu điền dã và sự tham gia của cộng đồng, dữ liệu có thể hỗ trợ việc xây dựng bản đồ phương ngữ, phát triển tài liệu giảng dạy, nghiên cứu sự biến đổi ngôn ngữ và bảo tồn những đặc trưng đang dần mai một.
Từ thành quả nghiên cứu công phu của Nguyễn Văn Tài, Digitizing Việt Nam đã tạo nên một nền tảng số để người dùng tiếp cận kho tàng ngữ âm và từ vựng tiếng Mường thuận tiện hơn. Bộ dữ liệu qua đó vừa tiếp nối giá trị của một công trình ngôn ngữ học nền tảng, vừa cho thấy khả năng của công nghệ số trong việc gìn giữ, tổ chức và lan tỏa di sản ngôn ngữ Việt Nam.
Khám phá bộ dữ liệu trên nền tảng Digitizing Việt Nam tại đây.