Giới thiệu GeneBench-Pro

Một tiêu chuẩn ở cấp độ nghiên cứu đo lường cách các tác nhân AI điều hướng sự mơ hồ và đưa ra các phán đoán mang tính hệ quả trong sinh học tính toán.
Dữ liệu khoa học hiếm khi đi kèm với hướng dẫn. Các nhà nghiên cứu phải quyết định xem một mẫu phản ánh sinh học hay tiếng ồn, liệu dữ liệu có thể hỗ trợ cho câu hỏi đang được hỏi hay không và mỗi kết quả sẽ thay đổi những gì họ làm tiếp theo như thế nào. Các tác nhân AI ngày càng có khả năng thực hiện các phân tích phức tạp, nhưng nghiên cứu khoa học thực sự cũng không chỉ phụ thuộc vào việc nhớ lại các sự kiện hoặc tuân theo quy trình làm việc được xác định trước mà còn phụ thuộc vào việc đưa ra các phán đoán ở cấp độ cao hơn này.
Hôm nay, chúng tôi xin giới thiệu GeneBench-Pro—một tiêu chuẩn cấp độ nghiên cứu đầy thách thức để kiểm tra xem liệu các mô hình có thể xử lý loại phân tích nặng về phán đoán mà sinh học tính toán trong thế giới thực yêu cầu hay không. Nó mở rộng trên GeneBench(opens in a new window) để bao gồm các nhiệm vụ khó hơn, thực tế hơn về gen, sinh học định lượng và y học tịnh tiến, nắm bắt sự phức tạp, tính chất lặp đi lặp lại và sự mơ hồ của nghiên cứu khoa học trong sinh học tính toán.
Cho đến nay, có rất ít đánh giá thuyết phục về các yêu cầu phán đoán ở cấp độ hệ thống khiến việc nghiên cứu tính toán trong thế giới thực trở nên khó khăn. Chúng bao gồm xử lý sự mơ hồ, sửa đổi các giả định, chọn đường dẫn phân tích chính xác và biết khi nào kết quả đã sẵn sàng để đưa ra quyết định. Vì những kỹ năng này khó chính thức hóa nên chúng cũng khó đánh giá một cách nghiêm ngặt, ngay cả khi những điểm yếu trong chúng ngày càng hạn chế hiệu suất tổng thể của AI.
GeneBench-Pro được thiết kế để đo lường chính xác những khả năng cấp cao hơn này. Trong GeneBench-Pro, chúng tôi định nghĩa “khẩu vị nghiên cứu” là các chuỗi phán đoán định hình một phân tích: câu hỏi nào mà dữ liệu có thể hỗ trợ, chẩn đoán sớm sẽ thay đổi mô hình hoặc ước tính như thế nào và khi nào cần sửa đổi kế hoạch ban đầu. Mỗi bài toán GeneBench-Pro cung cấp cho mô hình một tập dữ liệu thực tế và lộn xộn, bối cảnh thử nghiệm ngắn gọn và ước tính mục tiêu gắn liền với quyết định tiếp theo. Để trả lời chính xác, mô hình phải khám phá dữ liệu, chọn phương pháp phân tích thích hợp, tham gia vào quá trình thử nghiệm lặp đi lặp lại và đưa ra câu trả lời cuối cùng.
Xây dựng bộ dữ liệu
Trong sinh học, chi phí tạo ra dữ liệu (ví dụ: giải trình tự bộ gen) đã giảm đáng kể và một số nhà nghiên cứu hiện nay lập luận(opens in a new window) rằng yếu tố hạn chế không còn là việc thu thập mẫu mà là tính toán và phân tích tiếp theo. GeneBench-Pro được xây dựng để đánh giá tiến độ giải quyết nút thắt đó, với 129 câu hỏi bao gồm nhiều phương pháp và cài đặt sinh học tính toán.
Domain Atlas: 129 bài toán trong 10 miền và 21 miền phụ
Di truyền thống kê n=17
Di truyền quần thể n=21
Di truyền định lượng n=17
omics quy định n=17
Bộ gen chức năng n=9
Protein học n=7
Lâm sàng, PGx & chẩn đoán n=26
Bộ gen ung thư n=10
Bộ gen vi sinh vật n=3
Di truyền pháp y n=2
Sử dụng các phím mũi tên để di chuyển giữa các vấn đề về điểm chuẩn. Chi tiết của vấn đề đã chọn xuất hiện bên dưới.
Nhấp vào dấu chấm ở trên để tìm hiểu về vấn đề điểm chuẩn.
Tập bản đồ này cung cấp bản xem trước về bề rộng của GeneBench-Pro. Hãy truy cập trang nghiên cứu điển hình để khám phá 10 câu hỏi tiêu biểu một cách chi tiết hơn.
GeneBench-Pro cũng được thiết kế để tránh các lỗi điểm chuẩn thông thường. Nhiều tiêu chuẩn sinh học dài hạn xây dựng các câu hỏi gồm nhiều bước xung quanh các tập dữ liệu lịch sử lộn xộn, trong đó có thể không có đường dẫn chính xác duy nhất thông qua phân tích. Một tác nhân có thể chọn một giới hạn có thể bảo vệ được, trong khi một tác nhân khác có thể chọn một tùy chọn khác nhưng có thể bảo vệ được như nhau, phản ánh các lựa chọn tùy ý của người tạo điểm chuẩn hơn bất kỳ sự khác biệt cơ bản nào về hiệu suất mô hình. Điều ngược lại cũng có thể xảy ra: nếu một vấn đề quá thiếu nhạy cảm về mặt số học, tác nhân có thể mắc các lỗi cơ bản trong phân tích nhưng vẫn tạo ra kết quả đạt yêu cầu.
Để tránh các dạng lỗi này, mỗi bài toán GeneBench-Pro đều được xây dựng một cách tổng hợp: chúng tôi biết cấu trúc nguyên nhân đầy đủ và mô phỏng trực tiếp quá trình tạo dữ liệu. Điều đó cho phép chúng tôi điều chỉnh độ phức tạp của từng vấn đề, đảm bảo rằng những khác biệt hợp lý trong các lựa chọn phân tích chủ quan vẫn tạo ra kết quả bằng số được chấp nhận và xác minh (thông qua các nghiên cứu cắt bỏ) rằng các phân tích hợp lý nhưng không chính xác đều thất bại. Sau đó, chúng tôi kiểm tra các bản thảo vấn đề thông qua phân tích dấu vết chi tiết để kiểm tra rò rỉ thông tin và các lộ trình giải pháp ngoài ý muốn. Điều này giúp chúng tôi tin tưởng rằng việc có được câu trả lời đúng phụ thuộc vào việc chọn con đường phân tích chính xác chứ không phải khai thác một lối tắt hoặc phù hợp với sở thích tùy ý của tác giả.