Business.ThienMy.comThiện Mỹ Business
Công nghệ & AI

Sàng bớt chín mươi phần trăm thí nghiệm không đáng làm — phần mười còn lại vẫn phải làm thật

Trong nghiên cứu vật liệu và hoá chất, mô phỏng đã thu hẹp không gian thử nghiệm rất mạnh. Bài phân tích việc cụ thể này, con số đo được, và vì sao ống nghiệm không biến mất.

Sàng bớt chín mươi phần trăm thí nghiệm không đáng làm — phần mười còn lại vẫn phải làm thật

Có một dạng bài toán mà con người luôn thua vì lý do rất đơn giản: không gian tìm kiếm quá lớn.

Muốn tìm một hợp chất có tính chất mong muốn, số tổ hợp có thể thử là con số nhiều chữ số đến mức vô nghĩa. Một phòng thí nghiệm giỏi làm được vài chục thí nghiệm một tuần.

Nên cách làm truyền thống là dựa vào trực giác của người có kinh nghiệm: chọn ra vài chục ứng viên nghe có lý, thử, phần lớn thất bại, rút kinh nghiệm, chọn tiếp.

Cách đó có tác dụng. Nó cũng chậm và tốn kém một cách khủng khiếp.

Việc cụ thể: thu hẹp trước khi thử

Cái đã đổi không phải là máy tìm ra câu trả lời. Là máy loại bớt.

Đưa vào một triệu ứng viên, mô hình xếp hạng theo khả năng có tính chất cần tìm, và trả về vài trăm cái đáng thử. Phòng thí nghiệm thử vài trăm cái đó thay vì mò trong một triệu.

Đây là thay đổi về bậc độ lớn, không phải cải thiện vài phần trăm. Và nó có thật — nhiều lĩnh vực đã báo cáo rút ngắn thời gian tìm ứng viên từ nhiều năm xuống còn nhiều tháng.

Con số đo được, rất rõ ràng: bao nhiêu thí nghiệm phải làm để có một kết quả dùng được. Đó là chỉ số nên theo dõi, chứ không phải "có dùng công nghệ mới hay không".

Chỗ luôn bị nói quá

Ba lời hứa cần nghe với thái độ dè dặt:

"Không cần thí nghiệm nữa." Sai hoàn toàn. Mô phỏng nói cái gì đáng thử; thực tế nói cái gì đúng. Tỉ lệ ứng viên được xếp hạng cao mà thất bại khi làm thật vẫn rất lớn ở phần lớn lĩnh vực.

"Áp dụng được cho mọi ngành." Hiệu quả phụ thuộc nặng vào việc có sẵn dữ liệu thí nghiệm đã làm hay không. Lĩnh vực nào có kho dữ liệu tích luỹ hàng chục năm thì tiến rất nhanh. Lĩnh vực nào chưa có thì gần như không dùng được — và đây là khoảng cách đang mở rộng.

"Tìm ra thứ chưa ai nghĩ tới." Mô hình học từ những gì đã có, nên nó mạnh ở việc nội suy trong vùng đã biết và yếu ở việc bước ra ngoài. Những bước nhảy thật trong khoa học thường đến từ việc nhìn vấn đề theo cách khác — và đó không phải chỗ mạnh của thứ học từ quá khứ.

Một hệ quả về tổ chức phòng thí nghiệm

Khi việc chọn cái gì đáng thử rẻ đi, nút thắt dời sang khâu làm thí nghiệm và đo đạc.

Điều đó có nghĩa là khoản đầu tư đúng lúc này ở nhiều nơi không phải là phần tính toán, mà là năng lực thử nhanh: thiết bị chạy được nhiều mẫu song song, quy trình chuẩn hoá, và người vận hành có tay nghề.

Đây là hình dạng lặp lại ở mọi ngành mà một khâu bị san bằng: giá trị dồn về khâu chưa bị san bằng. Ai đầu tư đúng vào khâu đó thì được lợi kép.

Vấn đề dữ liệu, nói thẳng

Có một chuyện mà giới nghiên cứu biết nhưng ít nói ra: kết quả thí nghiệm thất bại gần như không được công bố.

Tạp chí không đăng, người làm không có động cơ viết, nên toàn bộ tri thức về "cái gì không được" nằm trong sổ tay và biến mất khi người đó chuyển việc.

Với con người thì đó là lãng phí. Với mô hình học từ dữ liệu thì đó là lỗi hệ thống: nó chỉ thấy phần thành công, nên nó ước lượng lệch một cách có hệ thống.

Nơi nào chịu khó lưu lại cả thất bại — có ghi rõ điều kiện, không chỉ ghi "không ra" — thì nơi đó có tài sản mà tiền không mua được. Và cũng như mọi loại dữ liệu khác: bắt đầu ghi từ hôm nay thì vài năm nữa mới có thứ để dùng.

Với doanh nghiệp: câu hỏi nên hỏi trước khi rót tiền

Rất nhiều doanh nghiệp Việt Nam đang được chào mời hợp tác nghiên cứu có gắn nhãn công nghệ mới. Ba câu hỏi lọc được phần lớn thứ không dùng được:

Dữ liệu huấn luyện đến từ đâu, và có bao nhiêu kết quả âm? Không có kết quả âm thì độ tin cậy thấp hơn nhiều so với con số được báo.

Đã có bao nhiêu ứng viên do mô hình đề xuất được kiểm bằng thí nghiệm thật, và tỉ lệ thành công là bao nhiêu? Đây là con số duy nhất đáng tin. Nếu bên chào hàng chỉ đưa ra chỉ số nội bộ của mô hình, thì họ chưa kiểm ngoài đời.

Ai sở hữu kết quả? Nghe như chuyện pháp lý phụ, nhưng với nghiên cứu chung thì đây là chỗ tranh chấp thường xuyên nhất, và phải rõ trước khi bắt đầu chứ không phải sau khi có kết quả tốt.

Phần AI không chạm tới

Nó không cầm được ống nghiệm. Nghe hiển nhiên nhưng hệ quả rất lớn: mọi kết quả vẫn phải qua bàn tay người, và tốc độ tổng thể bị chặn bởi khâu đó.

Nó không đặt được câu hỏi đáng hỏi. Chọn theo đuổi vấn đề nào, dừng hướng nào — đó là phán đoán mang cả yếu tố khoa học lẫn yếu tố sự nghiệp và nguồn lực. Không có mô hình nào thay được.

Nó không nhận ra kết quả bất thường đáng đào sâu. Rất nhiều phát hiện lớn bắt đầu từ một số liệu lệch mà người làm thấy lạ. Với mô hình, số liệu lệch là nhiễu cần loại.

Nó không hiểu vì sao. Xếp hạng được ứng viên không có nghĩa là giải thích được cơ chế. Mà không hiểu cơ chế thì không khái quát được sang bài toán kế tiếp — và khoa học sống bằng khái quát hoá, không bằng danh sách kết quả.

Nó không chịu trách nhiệm khi kết quả sai. Vẫn là người ký tên, người bảo vệ trước hội đồng, người trả lời khi có ai đó không lặp lại được kết quả.

Và cái tên

Khoa học là lĩnh vực mà uy tín tích luỹ chậm và mất nhanh, giống hệt học thuật — nhưng người đọc rộng hơn nhiều: doanh nghiệp công nghệ, nhà đầu tư, người làm chính sách, sinh viên.

Đó là nhóm đang bị bủa vây bởi tin tức phóng đại, và họ tìm kiếm chính xác cái ngược lại: một chỗ nói rõ cái gì đã chắc, cái gì mới là hứa hẹn, và cái gì đang bị thổi.

Khi khâu thực thi — dựng trang, viết bài, làm hình minh hoạ — đã rẻ ngang nhau cho tất cả, thì thứ còn phân biệt là quan điểm và một cái tên gõ thẳng được, tồn tại lâu dài.

AiKhoaHoc.com ngắn, gọi đúng lĩnh vực, và đủ rộng cho cả khoa học cơ bản lẫn ứng dụng.


Tên miền nhắc trong bài: AiKhoaHoc.com

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
Gọi ngay 0926138138