Ngày 24/08/2026 tại Toronto, Thomson Reuters trình làng Thomson — mô hình ngôn ngữ lớn do hãng tự huấn luyện và vận hành, không dựa vào lab AI bên ngoài. Điểm gây chú ý: chi phí chỉ bằng một phần nhỏ model frontier tương đương, trong khi quyền sở hữu và kiểm soát thuộc về hãng hoàn toàn.

Dữ liệu riêng là lợi thế

Các lab frontier đốt hàng tỷ USD tiền máy và nhiều năm dựng hạ tầng. Thomson Reuters đi đường khác: dùng kho dữ liệu pháp lý, thuế, tin tức, tài chính tích lũy hàng chục năm để huấn luyện model chuyên ngành. Kết quả là model nhỏ hơn, rẻ hơn nhưng trúng việc hơn với nghiệp vụ của hãng. Đây là công thức mà ngân hàng, bảo hiểm, y tế hoàn toàn có thể học theo: đừng đua model đa dụng, hãy thắng ở dữ liệu đặc thù.

Mặt trái cần tính

LLM tư nhân giá trị cao sẽ thành mục tiêu: trích xuất model qua API, đầu độc dữ liệu huấn luyện, rò rỉ dữ liệu độc quyền qua prompt. Ai theo con đường này cần đầu tư bảo mật song song ngay từ đầu — rate limit, kiểm toán truy vấn, tách bạch dữ liệu huấn luyện. Đọc thêm hướng ngược lại: mở weights Kimi K3 để thấy hai trường phái của năm 2026.

Nguồn tham khảo: Thomson Reuters. Bài viết do VietCyber biên soạn lại.