VERCEL

Xây dựng tác nhân thoại thời gian thực trên AI Gateway

Bùi Đăng MinhThứ hai, 29/6/2026, 10:00 (GMT+7)4 phút đọc
Xây dựng tác nhân thoại thời gian thực trên AI Gateway

AI Gateway hiện hỗ trợ âm thanh/giọng nói. Bạn có thể thêm giọng nói, văn bản vào giọng nói và lời nói vào văn bản theo thời gian thực bằng chính các cuộc gọi bạn đã sử dụng cho văn bản, hình ảnh và video, được định tuyến qua AI Gateway cùng với mọi phương thức khác.

Âm thanh ra mắt với các mẫu từ OpenAI và xAI. Mỗi cuộc gọi đều nhận được cùng một định tuyến, khả năng quan sát, kiểm soát chi tiêu và hỗ trợ mang theo chìa khóa của nhà cung cấp mà bạn đã sử dụng cho các mô hình khác của mình.

Những khả năng này đang ở giai đoạn thử nghiệm và có sẵn trong AI SDK 7.

Khả năng

Nó hoạt động như thế nào

Sử dụng nó cho

Giọng nói thời gian thực

Âm thanh vào và ra trực tiếp, để phát trực tuyến, phiên có độ trễ thấp

tác nhân thoại hai chiều và trò chuyện trực tiếp

Chuyển văn bản thành giọng nói

Văn bản vào, tập tin âm thanh ra, yêu cầu duy nhất

Thuyết minh, phản hồi bằng giọng nói, phiên bản âm thanh của nội dung bằng văn bản

Lời nói thành văn bản

Đã ghi âm thanh vào, văn bản ra, yêu cầu duy nhất

Chép lời ghi chú, ghi âm cuộc gọi

Bắt đầu

Mô hình thời gian thực, giọng nói và phiên âm được hỗ trợ trên AI SDK 7.

npm cài đặt ai @ai-sdk/react @ai-sdk/gateway

tác nhân giọng nói thời gian thực

Thời gian thực biến ứng dụng của bạn thành thứ mà người dùng có thể trò chuyện. Khi họ nói, người mẫu sẽ phản ứng ngay lập tức. Bởi vì nó trả lời ngay lập tức thay vì đợi hết lượt, người dùng có thể ngắt lời và nói chuyện theo cách họ làm với một người. Nó phù hợp với trợ lý giọng nói, nhân viên hỗ trợ khách hàng, công cụ rảnh tay và bất cứ nơi nào người dùng muốn nói chuyện hơn là gõ phím.

Điều khiến nó khác biệt so với việc kết nối các mô hình lại với nhau là một mô hình thời gian thực duy nhất nghe âm thanh và tạo ra âm thanh trực tiếp, thay vì chạy quy trình chuyển giọng nói thành văn bản, sau đó là mô hình ngôn ngữ, rồi chuyển văn bản thành giọng nói.

Trong trình duyệt, hook useRealtime quản lý kết nối WebSocket, thu âm micrô và phát lại âm thanh.

Kết nối được xác thực bằng thông tin xác thực AI Gateway của bạn, do đó, bạn đúc một mã thông báo tồn tại trong thời gian ngắn trên máy chủ và chỉ trao mã thông báo đó cho trình duyệt. Khóa API của bạn không bao giờ đến được với khách hàng. Thêm một tuyến đường tạo ra mã thông báo:

1nhập { cổng } từ '@ai-sdk/gateway';2
3xuất hàm không đồng bộ POST() {4 const { token, url } = chờ đợi cổng.experimental_realtime.getToken({5 model: 'openai/gpt-realtime-2',6 });7 return Response.json({ token, url, tools: [] });8}

Sau đó kết nối từ một thành phần máy khách:

Nguồn / Original source: Vercel (@vercel & @addyosmani)