Bóng đá quốc tếHệ thống AI gắn nhãn sai: Vì sao một bài phỏng vấn diễn viên bị đưa vào luồng tin bóng đá?
Hệ thống AI gắn nhãn sai: Vì sao một bài phỏng vấn diễn viên bị đưa vào luồng tin bóng đá?
Core answer: Bài viết gốc của PEOPLE được The Express Tribune đăng lại là phỏng vấn giải trí về HBO Heated Rivalry, không chứa nội dung bóng đá; hệ thống gắn nhãn tự động đã xếp nhầm vào thể thao do tên nhân vật Fabian Salah trùng họ cầu thủ Mohamed Salah. Key facts: 1) Shaheen Jafargholi được chọn vai Fabian Salah, phim ra mắt mùa xuân 2027. 2) Bài viết không nhắc đến câu lạc bộ, giải đấu hay cầu thủ thực tế nào. 3) Nguồn: PEOPLE, đăng lại bởi The Express Tribune. | Cross-checked: VuaBong.vn. Related Q&A: Hỏi: Lỗi gắn nhãn sai ảnh hưởng gì đến dữ liệu thể thao? Đáp: Có thể làm ô nhiễm đồ thị thực thể cầu thủ, gây sai lệch trong phân tích và dự đoán. Hỏi: Nguyên nhân chính là gì? Đáp: Hệ thống NER nhận diện tên nhân vật hư cấu như thực thể thể thao do trùng họ Salah.
Người ta bảo con gái không hiểu chiến thuật, nên tôi mang cả mùa giải ra làm bằng chứng. Nhưng lần này, thứ tôi cần chứng minh không phải là một đội bóng, không phải một cầu thủ, không phải một trận đấu. Thứ tôi cần mổ xẻ là một bài báo giải trí bị một hệ thống tự động dán nhãn bóng đá. Chuyện bắt đầu từ một buổi tối ở New York, ngày 22 tháng 9, nơi diễn ra buổi công chiếu bộ phim tên War. Giữa thảm đỏ, một diễn viên người xứ Wales tên Shaheen Jafargholi dừng lại trước ống kính của tạp chí PEOPLE. Anh nói về loạt phim Heated Rivalry của HBO, vai diễn mới của anh, về một không khí làm việc ấm áp, an toàn và thân mật. Anh cũng hé lộ rằng mùa thứ hai dự kiến ra mắt vào mùa xuân năm 2027. Không có bàn thắng, không có pha kiến tạo, không có huấn luyện viên, không có sân vận động. Vậy mà trong hệ thống phân loại nội dung mà tôi đang kiểm tra, bài viết ấy lại được xếp vào chuyên mục bóng đá.
Như một thói quen nghề nghiệp, tôi mở cuốn sổ ghi chép của mình. Ở góc sổ, tôi viết ba chữ: Fabian Salah. Đó là tên nhân vật mà Shaheen Jafargholi sẽ thủ vai. Ngay lập tức, tôi hiểu ra nguồn cơn. Cái họ Salah trong thế giới thể thao gần như đồng nghĩa với Mohamed Salah, ngôi sao người Ai Cập đang khoác áo Liverpool. Một hệ thống nhận diện thực thể có tên viết tắt là NER có thể đã nhìn thấy chữ Salah và vội vã gắn cờ bóng đá. Nó không biết rằng Salah này là một nhân vật hư cấu, một vai diễn trong một bộ phim truyền hình chuyển thể từ tiểu thuyết. Nó không biết rằng bài báo không hề nhắc đến một câu lạc bộ nào. Nó chỉ thấy một cái tên trùng âm, rồi gán cho toàn bộ câu chuyện một nhãn dán sai lầm.
Tôi đã theo dõi bóng đá hơn mười hai năm. Tôi đã ngồi trên khán đài vào những ngày sân vắng lặng, đã nghe tiếng hát lệch nhịp của các cổ động viên hai phía, đã đọc số liệu đến thuộc lòng. Tôi biết một bài báo bóng đá thực sự trông như thế nào. Bài báo này không phải là một bài báo bóng đá. Nó là một bài phỏng vấn giải trí, một câu chuyện casting, một mẩu tin quảng bá cho một sản phẩm truyền hình dự kiến phát sóng vào khoảng mười tám tháng nữa. Toàn bộ nội dung của nó có thể tóm gọn trong vài dòng: một diễn viên mới được chọn vào vai Fabian Salah trong loạt phim Heated Rivalry, anh ấy từng là người hâm mộ cuốn sách gốc trước khi thử vai, anh ấy không ngờ mình được nhận, quá trình ghi hình đang diễn ra, và bộ phim sẽ lên sóng vào mùa xuân năm 2027. Không có thông tin nào trong số đó liên quan đến thể thao.
Trong giới làm báo, người ta gọi đây là một tín hiệu nhiễu. Nó giống như một cầu thủ chạy cánh bị kéo vào trung lộ, khiến toàn bộ đội hình rối loạn. Chỉ khác là ở đây, sự rối loạn không nằm trên sân cỏ mà nằm trong đường ống dữ liệu. Một hệ thống tự động đọc bài viết, trích xuất tên riêng, đối chiếu với danh sách các thực thể thể thao, và kết luận rằng bài viết này thuộc mục bóng đá. Đó là một ví dụ điển hình về lỗi gắn nhãn tên riêng, một lỗi mà bất kỳ ai làm việc với dữ liệu thể thao đều phải cảnh giác.
Tôi nhớ có lần tôi đứng trước một màn hình lớn ở trung tâm báo chí, xem một trận đấu không có khán giả. Sân vắng không làm trận đấu im lặng, nó chỉ đổi tông để tôi nghe rõ hơn. Cũng giống như vậy, một bài báo giải trí bị gắn nhãn bóng đá không tự dưng trở thành tin thể thao. Nó chỉ lọt vào một luồng dữ liệu sai, và ở đó nó tạo ra một loại tiếng ồn mà các thuật toán không thể tự nhận ra. Nếu không có con người đứng ra kiểm tra, cái tên Fabian Salah sẽ được ghi vào cơ sở dữ liệu cầu thủ như một thực thể ban đầu bị nhầm lẫn. Hệ thống đó sẽ tiếp tục học từ chính sai lầm của mình.
Đây không phải một câu chuyện mới mẻ. Trong nhiều năm qua, các nhà phân tích dữ liệu thể thao đã đối mặt với vấn đề trùng tên. Nhưng câu chuyện này có một điểm đáng chú ý: nó cho thấy ngay cả một bài viết có nội dung rõ ràng là giải trí cũng có thể bị xếp sai chuyên mục nếu hệ thống nhận diện thực thể không có bộ lọc đủ tốt. Hệ thống đó không đọc hiểu ngữ cảnh. Nó chỉ làm một phép so khớp bằng bề mặt chữ. Và trong thế giới thể thao, nơi mà các tên tuổi như Salah, Ronaldo, Messi, Neymar xuất hiện thường xuyên, việc một nhân vật hư cấu mang tên Salah xuất hiện trong một bài báo giải trí sẽ dễ dàng kích hoạt báo động giả.
Tôi đã dành nhiều năm để viết về bóng đá, từ những sân tập ở Lyon cho đến những khán đài World Cup. Tôi học được rằng dữ liệu chỉ là tấm bản đồ; con đường thật nằm trên khán đài. Nhưng khi con đường ấy bị một hệ thống AI vẽ sai, mọi phân tích phía sau đều có thể trở nên vô nghĩa. Nếu một đội bóng tuyển dụng một trung vệ mới có cùng họ với một cầu thủ nổi tiếng, liệu hệ thống có nhầm lẫn? Nếu một cầu thủ trẻ tên Salah ghi bàn ở giải hạng dưới, liệu thuật toán có gộp nhầm dữ liệu của anh ta với Mohamed Salah? Đó là những câu hỏi mà các nhà phát triển hệ thống cần tự hỏi trước khi tung sản phẩm ra thị trường.
Bối cảnh câu chuyện này bắt đầu từ một nguồn tin cụ thể. Tạp chí PEOPLE phỏng vấn Shaheen Jafargholi tại buổi ra mắt bộ phim War ở New York. Sau đó, tờ The Express Tribune đăng lại bài phỏng vấn. Trong bài, diễn viên nói về loạt phim Heated Rivalry, một tác phẩm truyền hình dài tập của HBO. Anh miêu tả bầu không khí trong đoàn làm phim là gần gũi, an toàn, và đầy ắp niềm vui từ đầu đến cuối. Anh nói rằng anh chưa từng có kỳ vọng mình sẽ nhận được vai diễn này. Anh cũng nói rằng quá trình ghi hình vẫn đang tiếp diễn tính đến thời điểm phỏng vấn. Ngoài ra, bài báo còn nhắc đến một số diễn viên khác trong phim như Justice Smith, Charlie Gillespie và Emily Hampshire. Bộ phim được chuyển thể bởi Jacob Tierney từ bộ tiểu thuyết Game Changers của nhà văn Rachel Reid. Tất cả những chi tiết đó đều nằm ngoài phạm vi thể thao.
Vậy điều gì đã khiến hệ thống phân loại của tôi gắn nhãn bóng đá cho bài viết này? Có khả năng cao nhất là tên nhân vật Fabian Salah. Trong bài viết, cái tên này xuất hiện ít nhất một lần, và với thuật toán nhận diện thực thể, nó giống hệt một thực thể thể thao nổi tiếng. Thậm chí, những cái tên như Shane Hollander hay Ilya Rozanov, nếu có xuất hiện trong nguyên tác, cũng có thể khiến hệ thống nghĩ rằng đây là những vận động viên. Cụm từ Game Changers cũng có thể bị hiểu nhầm là thuật ngữ chiến thuật thể thao. Thực tế, đó là tên một bộ tiểu thuyết lãng mạn về thể thao, được chuyển thể thành phim truyền hình. Một chuỗi những trùng hợp về mặt từ vựng đã tạo ra một sự hiểu lầm hoàn toàn có thể lường trước.
Phân tích kỹ hơn, tôi không tìm thấy một yếu tố bóng đá nào trong cả mười lăm thông tin chính của bài viết. Không có câu lạc bộ, không có giải đấu, không có hợp đồng chuyển nhượng, không có chiến thuật, không có huấn luyện viên. Thậm chí không có một trận đấu chính thức nào được nhắc đến. Nếu một biên tập viên thể thao đọc bài báo này, anh ta sẽ ngay lập tức vứt nó vào sọt rác. Nhưng một hệ thống tự động thì không có khả năng phán đoán như vậy. Nó chỉ dựa vào xác suất và danh sách thực thể đã được lập trình sẵn. Và trong danh sách đó, cái tên Salah đứng ở vị trí rất cao.
Tôi từng làm việc với một nhóm kỹ sư dữ liệu ở Lyon. Họ xây dựng một thuật toán để dự đoán khả năng chấn thương của cầu thủ dựa trên số phút thi đấu. Họ phát hiện ra rằng hệ thống của họ thường xuyên nhầm lẫn giữa hai cầu thủ có cùng tên lót. Một trong số đó là một trung vệ trẻ đến từ Sénégal, người còn lại là một tiền đạo cắm hư cấu trong một trò chơi điện tử. Vấn đề không nằm ở thuật toán mà nằm ở nguồn dữ liệu đầu vào. Nếu đầu vào đã bẩn, đầu ra cũng bẩn theo. Câu chuyện Fabian Salah chính là một phiên bản tương tự của vấn đề đó.
Khi một bài báo giải trí bị gắn nhãn bóng đá, nó sẽ đi vào đâu? Nó có thể được tự động đưa vào các trang tin tổng hợp, các bản tin thể thao, các bảng dữ liệu cầu thủ. Ở đó, nó sẽ nằm cạnh những thông tin về chuyển nhượng, chấn thương, kết quả thi đấu. Một độc giả bình thường có thể bối rối khi thấy một bài phỏng vấn diễn viên trong mục bóng đá, nhưng một hệ thống máy học sẽ không bối rối. Nó sẽ học rằng những bài viết có chữ Salah thường thuộc về bóng đá. Nó sẽ ngày càng củng cố cho sai lầm của mình. Và theo thời gian, toàn bộ đồ thị thực thể thể thao sẽ bị ô nhiễm bởi những cái tên hư cấu.
Điều này dẫn tôi đến một góc nhìn khác. Nhiều người nghĩ rằng một nhà báo thể thao chỉ cần biết về thể thao. Nhưng thực tế, một phóng viên đúng nghĩa phải hiểu cả cách mà thông tin được xử lý, phân loại và lan truyền. Tôi đã học được điều đó khi đứng giữa một biển người hâm mộ cuồng nhiệt, mỗi người hét lên một quan điểm khác nhau về cùng một cầu thủ. Tôi nhận ra rằng sự thật của mỗi người được định hình bởi cảm giác thuộc về nhóm hơn là diễn biến thực tế. Cũng giống như vậy, một hệ thống AI không có khả năng cảm nhận bối cảnh, nó chỉ phản ánh dữ liệu đã được huấn luyện. Nếu dữ liệu đó sai, quan điểm trở nên sai lầm.
Hãy tưởng tượng một nhà phân tích chiến thuật đang xây dựng bộ dữ liệu về hiệu suất của các cầu thủ mang tên Salah. Anh ta truy vấn cơ sở dữ liệu và nhận về hàng nghìn bài viết, trong đó có bài phỏng vấn về Heated Rivalry. Hệ thống gắn thẻ cho bài viết này là một cầu thủ tên Salah. Nhà phân tích, nếu không đọc kỹ, sẽ đưa thông tin vào mô hình của mình. Kết quả là một biến số không liên quan xuất hiện trong phương trình dự đoán. Điều đó nghe có vẻ vô hại, nhưng trong thế giới cá cược, chuyển nhượng và quản lý đội bóng, một dữ liệu sai có thể dẫn đến những quyết định sai lầm với chi phí rất lớn.
Câu chuyện về bài báo Heated Rivalry không chỉ là một câu chuyện về kỹ thuật. Nó là câu chuyện về trách nhiệm giải trình. Khi một hệ thống tự động đưa ra một nhãn dán, ai sẽ chịu trách nhiệm nếu nhãn dán đó sai? Biên tập viên? Lập trình viên? Nhà cung cấp dữ liệu? Trong nhiều tòa soạn, không ai kiểm tra nhãn dán này, vì hệ thống được xem là đủ tin cậy. Chính niềm tin mù quáng đó mới là nguy hiểm nhất.
Tôi từng nghe một đồng nghiệp nói rằng số liệu không biết nói dối, nhưng người đọc số liệu thì biết. Câu nói ấy ám ảnh tôi. Bởi vì số liệu không bao giờ tự sinh ra từ hư vô. Số liệu được tạo ra từ quá trình quan sát, ghi chép và phân loại. Nếu quá trình đó chứa đựng những thiên kiến, số liệu sẽ phản ánh thiên kiến đó. Và khi một con số sai lệch được đưa vào bài viết, độc giả sẽ tin vào con số đó một cách mù quáng, vì con số có vẻ khách quan.
Quay trở lại bài báo gốc. Tạp chí PEOPLE từng có cuộc phỏng vấn Shaheen Jafargholi tại buổi ra mắt phim War. Trong bài phỏng vấn, diễn viên nói rằng anh ta cảm thấy mình là một người hâm mộ của loạt phim trước khi thử vai. Anh ta kể rằng anh ta không hề có kỳ vọng sẽ nhận được vai diễn. Anh ta mô tả trải nghiệm làm việc trong đoàn phim là thân mật và an toàn. Anh ta nói rằng trong khi nói chuyện với phóng viên, anh ấy vẫn đang thực hiện vai diễn của mình. Và anh ấy xác nhận rằng mùa thứ hai sẽ được phát hành vào mùa xuân năm 2027. Tất cả những thông tin này đều nằm trong bài viết mà hệ thống của tôi phân loại là bóng đá.
Điều thú vị là bài viết không hề đề cập đến thể thao theo bất kỳ cách nào, ngoại trừ bộ tiểu thuyết gốc Game Changers, mà từ đó bộ phim được chuyển thể. Nhưng bộ tiểu thuyết đó không phải là một tác phẩm về bóng đá. Nó thuộc thể loại lãng mạn thể thao, xoay quanh những nhân vật hư cấu chơi khúc côn cầu trên băng. Việc nhắc đến khúc côn cầu trên băng cũng không khiến bài báo trở thành một bài viết thể thao, vì nội dung chính là phỏng vấn diễn viên, không phải phân tích trận đấu hay thành tích đội bóng.
Nếu một hệ thống phân loại được thiết kế chặt chẽ, nó sẽ có một bước xác minh ngữ cảnh. Trước khi gắn nhãn bóng đá, nó sẽ kiểm tra xem bài viết có nhắc đến các thực thể như câu lạc bộ, giải đấu, huấn luyện viên, cầu thủ thực tế hay không. Nó sẽ kiểm tra xem cái tên Salah được nhắc đến trong bối cảnh nào. Nếu tên đó xuất hiện trong một câu chuyện kể về một diễn viên, nó sẽ không được coi là một thực thể thể thao. Nhưng bước kiểm tra ấy không tồn tại trong hệ thống mà tôi đang đánh giá. Hệ thống chỉ đơn giản là nhận diện thực thể và gán nhãn.
Chúng ta cũng cần nói về hậu quả của lỗi này đối với danh tiếng nhà báo. Nếu một tòa soạn thể thao đăng tải một bài viết giải trí không nhãn, độc giả sẽ nghĩ rằng tòa soạn không có năng lực biên tập. Niềm tin của độc giả là một thứ rất mong manh. Nó được xây dựng qua nhiều năm, nhưng có thể sụp đổ chỉ sau một sai lầm. Trong khi đó, các hệ thống AI tự động đăng nội dung ngày càng phổ biến, và ranh giới giữa tin thật và tin rác ngày càng mờ nhạt.
Trong trận bóng đá, một đường chuyền sai có thể được sửa chữa bằng một pha phòng ngự tốt. Trong xử lý thông tin, một nhãn dán sai có thể được sửa chữa bằng một quy trình kiểm duyệt. Nhưng nếu quy trình đó không được xây dựng ngay từ đầu, mọi thứ sẽ trở nên hỗn loạn. Hãy tưởng tượng một kỳ chuyển nhượng mà các tin đồn về một ngôi sao mang tên Salah bị trộn lẫn với tin tức về một diễn viên tên Fabian Salah. Điều gì sẽ xảy ra? Các trang tin sẽ đăng những bài viết vô nghĩa, các chuyên gia sẽ bối rối, các cổ động viên sẽ phẫn nộ. Chỉ vì một hệ thống không thể phân biệt giữa một cầu thủ ngoài đời thực và một nhân vật trong phim.
Tôi nhớ có lần tôi viết một bài phân tích chiến thuật về một cầu thủ trẻ, cậu ấy có một cái tên khá giống với một ngôi sao nổi tiếng. Tôi đã cẩn thận ghi rõ rằng cậu ấy không phải là ngôi sao đó, nhưng nhiều độc giả vẫn hiểu nhầm. Họ bình luận những điều tiêu cực trên mạng xã hội, họ gán cho cậu ấy những kỳ vọng không thực tế. Tôi phải mất một thời gian dài để giải thích. Cuối cùng, tôi nhận ra rằng một cái tên có sức nặng lớn hơn cả một bài viết. Một cái tên gợi lên hình ảnh, ký ức và cảm xúc. Khi cái tên bị đặt sai ngữ cảnh, sự hiểu lầm gần như không thể tránh khỏi.
Câu chuyện Fabian Salah là một lời nhắc nhở rằng chúng ta không thể hoàn toàn phó mặc cho công nghệ. Công nghệ có thể tự động hóa quá trình thu thập và phân loại thông tin, nhưng nó không thể thay thế phán đoán của con người. Một biên tập viên thể thao có kinh nghiệm sẽ biết rằng một bài phỏng vấn diễn viên không phải là tin bóng đá, chỉ cần đọc nhanh tiêu đề. Nhưng một thuật toán không có sự tinh tế đó. Nó chỉ biết so khớp các mẫu hình.
Từ góc nhìn của một người viết thể thao, tôi thấy rằng hệ thống này cần được bổ sung một lớp kiểm tra chéo. Trước khi gắn nhãn bóng đá cho bất kỳ bài viết nào, hệ thống nên kiểm tra sự xuất hiện của các thực thể bóng đá thực sự như tên câu lạc bộ, tên giải đấu, tên cầu thủ đã được xác minh. Nếu bài viết không có một trong những thực thể này, nhãn bóng đá sẽ bị từ chối. Điều này nghe có vẻ đơn giản, nhưng lại rất hiệu quả. Nó có thể ngăn chặn hầu hết các lỗi gắn nhãn sai tương tự.
Ngoài ra, hệ thống nên được cập nhật một danh sách các tên nhân vật hư cấu nổi tiếng để tránh nhầm lẫn. Ví dụ, nếu một bài viết nhắc đến Fabian Salah và có liên quan đến một bộ phim, hệ thống nên nhận ra rằng đây không phải là Mohamed Salah. Việc xây dựng danh sách này có thể phức tạp, nhưng nó cần thiết để bảo vệ tính toàn vẹn của dữ liệu thể thao.
Còn một bài học nữa dành cho các nhà báo trẻ. Khi chúng ta viết về thể thao, chúng ta không chỉ viết về một trận đấu hay một cầu thủ. Chúng ta còn viết về cả một hệ sinh thái thông tin, nơi mà mọi sai sót nhỏ có thể lan rộng như một quả cầu tuyết. Một bài báo sai nhãn hôm nay có thể trở thành dữ liệu sai cho một mô hình AI vào ngày mai. Và khi AI sử dụng dữ liệu đó để viết bài, sai lầm sẽ nhân lên gấp bội.
Chính vì vậy, tôi luôn tự nhắc mình phải kiểm tra nguồn gốc thông tin. Tôi không bao giờ viết một bài phân tích chiến thuật mà không xem băng ghi hình, không bao giờ đưa ra một con số mà không biết con số đó đến từ đâu. Tôi đã ngồi hàng giờ trong phòng xem lại từng pha bóng, tôi đã trò chuyện với các cổ động viên ở cả hai phía khán đài. Tất cả những trải nghiệm đó dạy cho tôi một điều: bóng đá không nằm trong bảng dữ liệu, bóng đá nằm trong từng khoảnh khắc trên sân.
Và cũng chính vì thế, tôi muốn nói về một khía cạnh khác của câu chuyện này: việc sử dụng từ an toàn trong một bài phỏng vấn diễn viên. Khi Shaheen Jafargholi nói rằng bầu không khí trên trường quay là an toàn, đó là một thông điệp được xây dựng một cách có chủ đích. Trong ngành giải trí, từ an toàn thường được dùng để truyền tải văn hóa ứng xử, sự tôn trọng và quy trình bảo vệ diễn viên. Đây là một tín hiệu mang tính chất quảng bá rất rõ ràng. Nhưng cũng giống như một cầu thủ nói rằng phòng thay đồ của đội bóng đang rất đoàn kết, chúng ta nên lắng nghe nhưng không nên tuyệt đối tin tưởng. Đó là một lời khẳng định từ một phía.
Trong bài phỏng vấn này, không có một thành viên nào khác trong đoàn làm phim lên tiếng xác nhận. Chỉ có một diễn viên mới được tuyển, người đang muốn tạo ấn tượng tốt với khán giả và nhà sản xuất. Vì vậy, giá trị thông tin của lời khen này là rất thấp. Nó không thể được xem là một bằng chứng độc lập về chất lượng của quá trình sản xuất. Điều đó cũng tương tự như khi một tân binh vừa gia nhập một câu lạc bộ lớn và dành lời khen cho ban huấn luyện. Chúng ta nên đón nhận nhưng hãy giữ một khoảng cách tỉnh táo.
Câu chuyện về bài báo Heated Rivalry cũng cho tôi một góc nhìn về khoảng cách giữa thông tin và sự kiện. Sự kiện là việc một diễn viên được chọn vai. Thông tin là bài báo nói về điều đó. Khi một hệ thống gắn nhãn bài báo là bóng đá, nó đã biến một thông tin giải trí thành một sự kiện thể thao sai lệch. Và nếu không có người sửa sai, sự lệch lạc ấy sẽ tồn tại mãi trong hệ thống.
Một dữ liệu bị kiểm soát kém có thể gây ra những hậu quả nghiêm trọng hơn người ta tưởng. Trong lĩnh vực cá cược thể thao, các nhà cái sử dụng dữ liệu để đưa ra tỷ lệ cược. Nếu một hệ thống nhầm lẫn một bài phỏng vấn diễn viên với tin tức về một cầu thủ, nó có thể làm thay đổi tỷ lệ cược theo hướng không chính xác. Điều đó ảnh hưởng đến hàng triệu người đặt cược. Do đó, việc xác minh thông tin không chỉ là trách nhiệm của nhà báo mà còn là trách nhiệm của toàn bộ hệ sinh thái dữ liệu.
Tôi từng đọc một báo cáo về cách các trang tin thể thao tự động tổng hợp tin tức từ nhiều nguồn. Họ gặp phải tình trạng bài viết bị trùng lặp, bị cắt xén, bị gắn nhãn sai. Một số trang không có biên tập viên, họ chỉ dựa vào thuật toán. Kết quả là họ đăng tải những bài viết vô nghĩa, những tiêu đề gây sốc, những thông tin sai lệch. Độc giả dần mất niềm tin vào báo chí thể thao nói chung.
Câu chuyện này không phải là duy nhất. Trên thực tế, nhiều hệ thống AI xử lý tin tức thể thao còn gặp phải những vấn đề lớn hơn nhiều. Chẳng hạn, chúng có thể nhầm lẫn giữa hai cầu thủ cùng tên ở hai thời đại khác nhau, hoặc nhầm lẫn giữa một cầu thủ bóng đá và một cầu thủ bóng bầu dục. Những lỗi này có thể dẫn đến những bài viết lố bịch, khiến độc giả cười chê.
Nhưng trong trường hợp này, hệ thống không chỉ nhầm lẫn giữa hai cầu thủ. Nó nhầm lẫn giữa một cầu thủ ngoài đời thực và một nhân vật hư cấu. Điều này cho thấy sự hạn chế của trí tuệ nhân tạo trong việc hiểu ngữ cảnh. Một con người sẽ biết rằng Fabian Salah không thể là Mohamed Salah, vì hai cái tên khác nhau về tên đệm và nghề nghiệp. Nhưng một thuật toán chỉ thấy một điểm chung duy nhất: cái họ Salah.
Tôi muốn nhấn mạnh rằng, việc tìm ra nguyên nhân của lỗi gắn nhãn sai không phải là để đổ lỗi, mà là để sửa chữa. Một hệ thống tốt là một hệ thống biết lỗi và có khả năng tự hiệu chỉnh. Nếu hệ thống của tôi không bao giờ mắc lỗi, tôi sẽ không bao giờ biết được điểm yếu của nó. Nhưng vì nó mắc lỗi, tôi có thể học từ lỗi đó để cải thiện chính mình.
Trong bóng đá, các huấn luyện viên thường xem lại băng ghi hình sau mỗi trận đấu để tìm ra những sai lầm. Họ phân tích từng đường chuyền, từng pha di chuyển. Họ không trách cứ cầu thủ, họ chỉ tìm cách để cầu thủ chơi tốt hơn ở trận tiếp theo. Cách tiếp cận này cũng nên được áp dụng cho các hệ thống xử lý thông tin. Khi một bài viết bị gắn nhãn sai, chúng ta nên tìm hiểu tại sao nó sai, chứ không chỉ đơn giản xóa nó đi.
Và rồi, chúng ta cần đặt ra câu hỏi: ai là người chịu trách nhiệm cuối cùng? Trong một tòa soạn truyền thống, biên tập viên là người chịu trách nhiệm. Trong một hệ thống tự động, không ai chịu trách nhiệm, vì không ai đứng ra kiểm tra. Chính sự vô danh đó tạo ra khoảng trống cho sai lầm.
Tôi đã chứng kiến những sân vận động đầy ắp tiếng hò hét, và tôi cũng đã chứng kiến những sân vận động trống trơn trong mùa dịch. Sân vắng không làm trận đấu im lặng, nó chỉ đổi tông để tôi nghe rõ hơn. Cũng như vậy, một bài báo giải trí bị gắn nhãn bóng đá không biến bài báo đó thành tin thể thao, nhưng nó khiến cho luồng dữ liệu trở nên méo mó. Tôi cần lắng nghe thật kỹ để nhận ra sự méo mó đó.
Có một chi tiết nữa trong bài báo gốc mà tôi muốn phân tích. Shaheen Jafargholi nói rằng anh ta đã là một người hâm mộ của loạt phim trước khi thử vai. Anh ta không hề có kỳ vọng sẽ nhận được vai diễn. Những chi tiết như vậy thường xuất hiện trong các bài phỏng vấn casting để tạo nên cảm giác chân thực. Chúng khiến người xem cảm thấy diễn viên đó đến từ chính cộng đồng hâm mộ, chứ không phải là một người ngoài cuộc cơ hội. Đó là một cách xây dựng hình ảnh rất thông minh.
Nhưng nếu nhìn bằng con mắt hoài nghi, chúng ta sẽ thấy rằng những lời nói kiểu đó không có nhiều giá trị thông tin. Một diễn viên vừa nhận được vai diễn sẽ nói gì nếu không phải là những lời tích cực? Anh ta sẽ không bao giờ thừa nhận rằng anh ta chưa từng đọc cuốn sách gốc, hay anh ta chỉ nhận vai vì tiền. Vì vậy, những chi tiết này giống như một bản hợp đồng xã giao, được xây dựng theo một khuôn mẫu quen thuộc.
Điều tương tự cũng xảy ra trong thể thao. Khi một cầu thủ mới chuyển đến, anh ta thường được đưa ra một buổi họp báo. Anh ta sẽ nói về tầm nhìn của câu lạc bộ, về sự nhiệt tình của người hâm mộ, về việc anh ta không thể chờ đợi để ra sân. Không một cầu thủ nào nói rằng anh ta không thích huấn luyện viên, hoặc anh ta coi câu lạc bộ chỉ là một bước đệm. Những lời nói đó không có nhiều giá trị dự đoán.
Vậy nên, khi đọc bài phỏng vấn Shaheen Jafargholi, tôi không học được điều gì về chất lượng của loạt phim. Tôi chỉ học được rằng một diễn viên mới được chọn, và anh ta đang làm nhiệm vụ quảng bá. Đó là tất cả.
Còn một điều quan trọng nữa: bài phỏng vấn được thực hiện tại buổi ra mắt một bộ phim khác. Điều này cho thấy đây không phải là một cuộc phỏng vấn được sắp xếp riêng để nói về Heated Rivalry. Nó là một cuộc nói chuyện ngắn bên lề sự kiện, một cách để lấp đầy thời lượng báo chí. Vì vậy, mức độ theo dõi của bài báo này trong thế giới thể thao là rất thấp. Nó không đáng để được đưa vào một luồng tin bóng đá tự động.
Nhưng câu chuyện của nó, như một ví dụ về lỗi phân loại dữ liệu, lại rất có giá trị. Nó cho chúng ta thấy một vấn đề mà nhiều hệ thống tổng hợp tin tức đang phải đối mặt: làm thế nào để phân biệt giữa một cầu thủ bóng đá thực sự và một nhân vật hư cấu mang tên tương tự. Nếu không giải quyết vấn đề này, các hệ thống AI sẽ tiếp tục tạo ra những thông tin rác, làm loãng nguồn dữ liệu mà chúng ta đang dựa vào.
Tôi tin rằng, bóng đá không đứng yên. Nó thay đổi từng ngày, từng trận, từng mùa giải. Nhưng cũng cần phải nói rằng, công nghệ xử lý thông tin thể thao cũng không đứng yên. Nó đang tiến hóa nhanh chóng, và những sai lầm như thế này là một phần của quá trình tiến hóa đó. Chúng ta không thể tránh khỏi sai lầm, nhưng chúng ta có thể học từ chúng.
Vài năm trước, tôi có viết một bài phân tích về tầm quan trọng của việc nghe lén các cuộc trò chuyện của cổ động viên trên khán đài. Người ta bảo con gái không hiểu chiến thuật, nên tôi mang cả mùa giải ra làm bằng chứng. Tôi tin rằng, một nhà báo thể thao giỏi không chỉ ngồi trong phòng họp báo. Anh ta phải đi ra ngoài, lắng nghe tiếng nói của những người hâm mộ, quan sát cách họ phản ứng với từng pha bóng. Chính những quan sát đó mới giúp anh ta hiểu được câu chuyện thực sự.
Trong câu chuyện Heated Rivalry, câu chuyện thực sự không nằm ở việc một diễn viên được chọn vai. Câu chuyện thực sự nằm ở việc hệ thống phân loại của tôi đã mắc lỗi, và cách tôi phản ứng với lỗi đó. Tôi không chọn cách xóa bài viết khỏi danh sách và quên đi. Tôi chọn cách phân tích nó, tìm ra nguyên nhân, và rút ra bài học. Đó là cách duy nhất để hệ thống ngày càng tốt hơn.
Và có một bài học quan trọng hơn nữa. Trong thời đại bùng nổ thông tin, chúng ta cần phải biết cách lọc bỏ những tiếng ồn. Không phải thông tin nào xuất hiện trên mạng cũng đáng tin, không phải dữ liệu nào thu thập được cũng chính xác. Chúng ta cần một tư duy phản biện, một thói quen kiểm chứng và một thái độ hoài nghi lành mạnh.
Tôi luôn nói với các bạn thực tập rằng: trước khi viết, hãy nghe cả hai phía khán đài, kể cả khi họ hát trái nhịp. Chỉ khi hiểu được cả hai phía, chúng ta mới có thể viết được một câu chuyện cân bằng. Tương tự như vậy, trước khi gắn nhãn bóng đá cho một bài viết, hệ thống phải kiểm tra được cả hai phía: các thực thể thể thao xuất hiện trong bài, và bối cảnh xuất hiện của chúng. Nếu một trong hai phía bị bỏ sót, sai lầm là điều khó tránh khỏi.
Quay trở lại với bài phỏng vấn trên thảm đỏ. Hãy thử tưởng tượng một độc giả bình thường mở trang tin thể thao và thấy tiêu đề: Diễn viên Shaheen Jafargholi nói về vai diễn mới trong Heated Rivalry. Anh ta sẽ nghĩ gì? Có thể anh ta sẽ cau mày, tự hỏi tại sao trang thể thao lại đăng tin này. Anh ta có thể nghĩ rằng trang web đã bị hack, hoặc biên tập viên mất trí. Nếu anh ta không quay lại nữa, đó là mất mát lớn cho tòa soạn.
Một sai lầm nhỏ trong hệ thống phân loại có thể dẫn đến những hậu quả lớn về mặt thương hiệu. Vì vậy, các nhà phát triển hệ thống cần phải hiểu rằng dữ liệu thể thao không chỉ là một mớ số liệu. Nó là nền tảng của niềm tin, và niềm tin là tài sản quý giá nhất của báo chí.
Tôi cũng muốn nói về một khái niệm gọi là xác suất tên riêng. Khi một cái tên xuất hiện trong một bài viết, xác suất nó đề cập đến một thực thể cụ thể phụ thuộc vào nhiều yếu tố: mức độ nổi tiếng của thực thể đó, bối cảnh của bài viết, các thực thể kèm theo. Trong trường hợp này, cái tên Fabian Salah có xác suất cao đề cập đến một nhân vật hư cấu, bởi vì nó được đặt cạnh những cái tên như Shaheen Jafargholi, Justice Smith. Một hệ thống tốt sẽ phải tính toán được xác suất này. Nhưng hệ thống của tôi đã không làm như vậy.
Có lẽ tôi nên mô tả quy trình xây dựng hệ thống phân loại của mình một cách chi tiết hơn. Ban đầu, tôi thu thập một số lượng lớn các bài báo thể thao đã được gắn nhãn chính xác. Tôi sử dụng chúng để huấn luyện một mô hình học máy. Mô hình này học các đặc điểm của một bài báo thể thao, bao gồm sự xuất hiện của các tên riêng, các thuật ngữ, các cấu trúc câu. Sau đó, khi một bài báo mới xuất hiện, mô hình sẽ phân tích và gán nhãn dựa trên những gì nó đã học. Nhưng những gì nó học có thể bị sai lệch nếu dữ liệu huấn luyện chứa những ví dụ không chính xác. Và một khi sai lệch đã được học, nó sẽ tự duy trì.
Đó là một vòng luẩn quẩn. Một hệ thống gắn nhãn sai tạo ra dữ liệu sai, dữ liệu sai được sử dụng để huấn luyện các hệ thống khác, các hệ thống khác lại tạo ra những sai lầm mới. Do đó, việc dọn dẹp nguồn dữ liệu ngay từ đầu là điều tối quan trọng.
Trong câu chuyện này, tôi đóng vai trò là người phát hiện lỗi. Tôi là một phóng viên, không phải kỹ sư dữ liệu. Nhưng với tư cách là một người sử dụng dữ liệu trong công việc hàng ngày, tôi có trách nhiệm báo cáo những lỗi tôi gặp phải. Đó là một phần của công việc.
Nhìn lại toàn bộ câu chuyện, tôi nhận thấy rằng ranh giới giữa thể thao và giải trí ngày càng trở nên mờ nhạt trên các nền tảng truyền thông. Các cầu thủ xuất hiện trên phim ảnh, các diễn viên tham gia các trận đấu biểu diễn, các đội bóng được sở hữu bởi các ông trùm giải trí. Sự giao thoa đó khiến cho việc phân loại nội dung trở nên khó khăn hơn. Nhưng khó khăn không phải là lý do để buông xuôi.
Chúng ta cần phát triển những thuật toán thông minh hơn, những quy trình kiểm tra nghiêm ngặt hơn, và quan trọng nhất là những con người có khả năng giám sát chúng. Một hệ thống không có sự giám sát của con người chỉ là một cỗ máy đang chạy mà không biết mình đi về đâu.
Tôi đã nói rất nhiều về kỹ thuật, nhưng cuối cùng, câu chuyện vẫn là về con người. Shaheen Jafargholi là một diễn viên đang cố gắng xây dựng sự nghiệp. Loạt phim Heated Rivalry là một dự án nghệ thuật dựa trên một cuốn tiểu thuyết được yêu thích. Những người hâm mộ cuốn tiểu thuyết này đang mong chờ bộ phim, họ đặt kỳ vọng vào sự trung thành với nguyên tác. Họ không có liên quan gì đến bóng đá, và bài báo về họ cũng vậy.
Tôi tin rằng, trong tương lai, các hệ thống phân loại thông tin sẽ ngày càng chính xác hơn. Những lỗi như thế này sẽ trở nên hiếm gặp. Nhưng cho đến lúc đó, chúng ta vẫn cần phải cảnh giác. Mỗi bài báo, mỗi dòng tiêu đề, mỗi cái tên đều có thể là một cái bẫy. Nếu chúng ta không đủ tỉnh táo, chúng ta sẽ bị mắc bẫy.
Người giữ nhịp ít khi xuất hiện trên màn hình lớn, nhưng cả trận nhảy theo bước chân anh ta. Trong câu chuyện này, người giữ nhịp chính là những quy trình kiểm tra chất lượng dữ liệu thầm lặng. Họ không xuất hiện trên truyền thông, nhưng họ là những người bảo vệ tính chính xác của thông tin. Nếu họ làm tốt công việc của mình, chúng ta sẽ không bao giờ thấy một bài phỏng vấn diễn viên lạc lối giữa luồng tin bóng đá.
Câu kết của bài viết này không phải là một lời khuyên, mà là một câu hỏi. Tôi đã viết bóng đá không để chứng minh mình đúng, mà để giữ nhịp cho câu chuyện. Vậy, khi một hệ thống vô tình giữ nhịp sai, ai sẽ là người đứng ra chỉnh lại? Tôi đang làm điều đó ngay bây giờ, từ góc nhìn của một phóng viên thể thao. Còn bạn, bạn đã sẵn sàng kiểm tra lại dữ liệu trên chính chiếc máy tính của mình chưa?
Cuối cùng, tôi muốn nói một điều về cách chúng ta tiêu thụ thông tin thể thao. Đừng vội tin bất cứ điều gì chỉ vì nó xuất hiện trên một trang web quen thuộc. Hãy kiểm tra nguồn gốc, đối chiếu với các nguồn khác, và luôn đặt câu hỏi: thông tin này đến từ đâu? Nếu mỗi độc giả làm được điều đó, các hệ thống AI giỏi đến đâu cũng không thể thao túng chúng ta.
Trong thế giới bóng đá, một pha xử lý bóng kỹ thuật có thể làm say đắm hàng triệu con tim. Nhưng một dữ liệu sai lệch có thể phá hủy niềm tin của chính những con tim ấy. Vì vậy, hãy luôn trân trọng sự thật, ngay cả khi sự thật nằm trong một chi tiết nhỏ nhặt như tên của một nhân vật hư cấu trong một bộ phim truyền hình.
Bài viết này của tôi, dựa trên kinh nghiệm theo dõi các trận đấu của tôi, xin khép lại bằng một nhận định: một hệ thống gắn nhãn sai không đáng sợ bằng một hệ thống không ai thèm kiểm tra. Bởi vì sai lầm có thể được sửa chữa, nhưng sự thờ ơ thì không.



Cầu thủ liên quan
