Đánh giá hiệu suất và hiệu quả của việc khai thác tác nhân GitHub Copilot trên các mô hình và nhiệm vụ

Trong khi mô hình cung cấp thông tin tình báo thô, dây nịt định hình mức độ hiệu quả của thông tin đó được áp dụng. Khai thác tác nhân GitHub Copilot là một thành phần được chia sẻ duy nhất của GitHub Copilot SDK, hỗ trợ GitHub Copilot CLI, ứng dụng GitHub Copilot và đánh giá mã Copilot, cùng với nhiều trải nghiệm khác nhau trên GitHub và Microsoft. Cải thiện dây nịt và mọi bề mặt đều được hưởng lợi.
Các công cụ, bối cảnh và quy trình làm việc được điều phối bởi bộ khai thác. Việc khai thác phải nhanh, hiệu quả về mã thông báo và có thể dự đoán được cho các nhà phát triển. Đó là những gì chúng tôi đã thiết kế để thực hiện hoạt động khai thác tác nhân của GitHub Copilot.
Trong bài đăng này, chúng tôi sẽ trình bày dữ liệu cho thấy hiệu quả và hiệu suất của việc khai thác tác nhân GitHub Copilot trên một loạt các nhiệm vụ kỹ thuật phần mềm tác nhân.
Chúng tôi đang thực hiện nhiều tối ưu hóa hơn
Đọc thêm về các tối ưu hóa mới nhất của chúng tôi về xử lý ngữ cảnh và định tuyến mô hình để tận dụng tối đa từng mã thông báo. Chúng tôi cũng đã chia sẻ thêm về các thử nghiệm và tối ưu hóa xung quanh việc ủy quyền cũng như lợi ích của việc ủy quyền này đối với các nhà phát triển ngày nay.
Cách chúng tôi lặp lại với điểm chuẩn
Chúng tôi liên tục đánh giá khả năng và hiệu quả của việc khai thác tác nhân GitHub Copilot thông qua sự kết hợp giữa các tiêu chuẩn công khai và được phát triển nội bộ. Điểm chuẩn công khai của chúng tôi bao gồm các tiêu chuẩn ngành, trong khi một số điểm chuẩn nội bộ được lấy từ các cơ sở mã lớn bên trong GitHub và Microsoft. Chúng tôi bổ sung điều này bằng các số liệu trong thế giới thực và thử nghiệm trực tuyến để đảm bảo chúng tôi hiểu được hiệu suất của dây nịt trong môi trường được kiểm soát cũng như tác động thực tế của nó đối với việc giải quyết vấn đề tác nhân và hoàn thành nhiệm vụ.
Chúng tôi kiểm soát càng nhiều biến số càng tốt để đánh giá hiệu suất khai thác của GitHub Copilot so với khai thác của nhà cung cấp mô hình: sử dụng cùng một mô hình, cùng một tác vụ điểm chuẩn, được chuẩn hóa trên cửa sổ ngữ cảnh, nỗ lực lý luận, lựa chọn công cụ và máy chủ MCP.
Dưới đây, chúng tôi báo cáo kết quả mới nhất của mình cho một tập hợp con các điểm chuẩn mà chúng tôi theo dõi, trên bốn mô hình hàng đầu: Claude Sonnet 4.6, Claude Opus 4.7, GPT‑5.4 và GPT‑5.5:
Trong suốt quá trình, chúng tôi so sánh GitHub Copilot CLI với các bộ khai thác nguyên bản của nhà cung cấp mô hình cung cấp các mô hình đó: Mã Claude cho Sonnet 4.6 và Opus 4.7 và Codex CLI cho GPT‑5.4 và GPT‑5.5.
Hiệu quả mã thông báo
Giữ mô hình và nhiệm vụ cố định trên nhiều kết quả điểm chuẩn, khai thác GitHub Copilot đạt được tỷ lệ hoàn thành nhiệm vụ ngang bằng với các khai thác khác của nhà cung cấp mô hình, đồng thời hiển thị mức tiêu thụ mã thông báo thấp hơn trên hầu hết các cấu hình.
Giải quyết nhiệm vụ
Hiệu quả của mã thông báo chỉ quan trọng nếu công việc thực sự được hoàn thành.
Tốc độ phân giải tác vụ đối với khai thác tác nhân GitHub Copilot trên các điểm chuẩn này ngang bằng với các khai thác của nhà cung cấp mô hình khi được sử dụng với một mô hình cố định và nhiệm vụ điểm chuẩn. Điều này đảm bảo rằng toàn bộ tiềm năng của mô hình cơ bản luôn sẵn có, cùng với tính linh hoạt của nhiều mô hình, hiệu quả của mã thông báo cũng như khả năng của bộ nhớ và ngữ cảnh.
Những kết quả này phản ánh tính tương đương hiệu quả, vì sự khác biệt ở một trong hai hướng nằm trong phương sai do tính chất ngẫu nhiên của các mô hình, làm cho hiệu suất khai thác chéo ngang bằng.
TerminalBench: Hiệu quả của mã thông báo, hoàn thành nhiệm vụ và phương sai
Để liên tục cải thiện việc khai thác tác nhân GitHub Copilot về khả năng hoàn thành nhiệm vụ và hiệu quả của mã thông báo, chúng tôi thường xuyên thực hiện các phân tích kỹ lưỡng về các điểm chuẩn. Dưới đây là ví dụ về phân tích phương sai trên TerminalBench 2.0, không chỉ nêu bật sức mạnh của GitHub Copilot trong việc hoàn thành nhiệm vụ và hiệu quả của mã thông báo mà còn cho thấy phương sai nội tại trong từng lần chạy của loại điểm chuẩn này.
Mỗi điểm đánh dấu là một cấu hình tác nhân và mô hình trên TerminalBench 2.0, với tốc độ phân giải trên trục tung và chi phí tính bằng đô la cho mỗi tác vụ trên trục hoành. Hình elip được tô bóng xung quanh mỗi điểm hiển thị mức chênh lệch ±1σ từ lần chạy này sang lần chạy khác, hiển thị mức độ khác nhau của từng cấu hình giữa các lần chạy.
Có ba điều nổi bật:
Một dây nịt, nhiều mẫu mã
Khai thác tác nhân GitHub Copilot hỗ trợ hơn 20 mô hình biên giới trong các dòng GPT, Claude, Gemini và MAI, đồng thời mang theo khóa riêng của bạn cho các mô hình cục bộ và nguồn mở. Bạn có thể chọn mô hình phù hợp với khả năng và hồ sơ chi phí của từng nhiệm vụ hoặc để lựa chọn mô hình Tự động chọn cho bạn, cân bằng mục đích nhiệm vụ và tình trạng mô hình để tối ưu hóa hiệu quả của mã thông báo.
Kiến trúc đa mô hình cũng mở ra các khả năng ở cấp độ dây nịt mà dây đai của nhà cung cấp mẫu mã không thể cung cấp. Ví dụ: Rubber Duck sử dụng phương pháp phê bình giữa các mô hình-gia đình, trong đó một mô hình đánh giá công việc của người khác để cải thiện kết quả vượt xa những gì mà bất kỳ mô hình đơn lẻ nào tạo ra riêng lẻ.
Phần kết luận
Điểm chuẩn chỉ là một tín hiệu trong số nhiều tín hiệu. Chúng tôi không ngừng nỗ lực cải thiện chất lượng dựa trên các điểm chuẩn, số liệu sử dụng trong thế giới thực và thử nghiệm trực tuyến, đồng thời nỗ lực tận dụng tối đa mọi mã thông báo một cách hiệu quả.
GitHub Copilot cung cấp độ phân giải nhiệm vụ ngang bằng với các khai thác của nhà cung cấp mô hình hàng đầu trong khi sử dụng ít mã thông báo hơn trên một số cấu hình mà không khóa bạn vào một mô hình duy nhất thông qua kiến trúc đa mô hình của nó. Đối với các nhà phát triển, điều này có nghĩa là bạn có thể hoàn thành nhiệm vụ tương đương với chi phí mã thông báo thấp hơn, trong khi vẫn chọn mô hình phù hợp nhất với nhiệm vụ của mình.
Hãy tự mình thử
Hãy dùng thử GitHub Copilot với mô hình bạn chọn, so sánh các phương pháp tiếp cận đối với các nhiệm vụ bạn thực hiện hàng ngày và xem các mô hình và chiến lược tác nhân khác nhau hoạt động như thế nào trong môi trường của bạn.
Tìm hiểu thêm về:
• CLI phi công phụ GitHub
• Ứng dụng GitHub Copilot
• SDK thí điểm GitHub
Khai thác tác nhân tương tự cung cấp năng lượng cho những trải nghiệm này. Chúng tôi đang tiếp tục cải thiện chất lượng, hiệu quả và tính linh hoạt của nó.
Phương pháp luận
Để so sánh được kiểm soát và tái tạo tốt nhất có thể, chúng tôi chạy từng tác nhân với cài đặt tương đương trên các mô hình, nhiệm vụ và môi trường.
Tất cả các lần chạy đều có thời gian chờ là hai giờ. Tất cả các tổng đài viên đều chạy một lượt không tương tác, tắt các công cụ web và cho phép tất cả các công cụ.
Phân tích TerminalBench2: Cài đặt mặc định được bật cho các tổng đài viên có nỗ lực suy luận được đặt ở mức trung bình (ví dụ: tìm kiếm công cụ được bật cho Mã Claude và Copilot CLI sử dụng github-mcp-server). Codex và Claude Code sử dụng các điểm cuối Anthropic và OpenAI trực tiếp. Để đảm bảo kết quả đầy đủ và đáng tin cậy, mọi dữ liệu bị thiếu hoặc lỗi liên quan đến cơ sở hạ tầng đều được chạy lại cho đến khi tất cả 89 tác vụ TerminalBench2 đều có kết quả. Các lỗi do mô hình tạo ra được giữ lại và không bị loại khỏi phân tích. Mỗi mô hình được đánh giá qua năm lần chạy độc lập và Copilot đã được thử nghiệm theo hai đợt đánh giá riêng biệt để có thể so sánh với Claude Code và Codex.
Tất cả các điểm chuẩn: Tất cả các cặp mô hình tác nhân được chuẩn hóa theo cùng kích thước cửa sổ ngữ cảnh, cùng giới hạn mã thông báo lời nhắc, nỗ lực lý luận (trung bình) và cài đặt—không tìm kiếm công cụ, không có máy chủ MCP. Giữ các công cụ tích hợp mặc định của dây nịt. Những bất thường liên quan đến cơ sở hạ tầng và các hiệu ứng truy cập mạng được loại trừ trên tất cả các tác nhân để lấy điểm chuẩn nhằm đảm bảo so sánh công bằng. Để giảm tác động của sự thay đổi từ lần chạy này đến điểm chuẩn nhỏ hơn (<100 trường hợp), năm lần chạy độc lập đã được tiến hành và lần chạy đạt điểm cao nhất sẽ được báo cáo. Tất cả số liệu được trình bày dưới dạng pass@1. Những chuẩn hóa này có nghĩa là kết quả sẽ khác với kết quả gửi điểm chuẩn công khai, thường sử dụng nỗ lực lý luận cao hơn và các cài đặt được điều chỉnh khác.
Bài đăng Đánh giá hiệu suất và hiệu quả của việc khai thác tác nhân GitHub Copilot trên các mô hình và nhiệm vụ xuất hiện đầu tiên trên Blog GitHub.