Gemini 3.8 Live biến giọng nói thành giao diện cho đôi tay bận rộn

Ảnh: Gemini 3.8 Live biến một cuộc trao đổi bằng giọng nói thành hành động có ngữ cảnh
Ngày 15/9, Google triển khai Gemini 3.8 Live, mô hình giọng nói thời gian thực tiết kiệm chi phí với khả năng bám theo hình ảnh. Công ty cũng giới thiệu Gemini 3.8 Live Extended Thinking, dành cho tác tử giọng nói có thể vừa suy luận vừa nói khi xử lý nhiệm vụ nhiều bước.
Lần ra mắt này gợi ý một thay đổi về giao diện, chứ không chỉ là nâng cấp mô hình. Tác tử có thể đồng hành khi tay bạn đang bận, dùng những gì ở trước mắt và đi qua một nhiệm vụ mà không bắt bạn gõ từng bước.
Hai chế độ Live, một hướng đi
Gemini 3.8 Live là con đường hội thoại thời gian thực, có khả năng bám theo hình ảnh. Bản Extended Thinking thêm việc vừa suy luận vừa nói trong công việc nhiều bước. Một trao đổi nhanh và một nhiệm vụ dài có thể dùng chung giao diện giọng nói nhưng cần cách suy luận khác nhau.
Google tích hợp trải nghiệm này vào Search Live và ứng dụng Gemini Live, cùng Docs cho người dùng Pro và Ultra, Gmail và Keep dành cho người đăng ký AI. Giọng nói được đặt cạnh những công cụ mọi người đã dùng để tìm kiếm, viết và lưu thông tin, thay vì chỉ là một màn trình diễn độc lập.
Một điểm số và đối thủ cùng tuần
Gemini 3.8 Live đứng đầu Artificial Analysis Speech-to-Speech Index với điểm 82,6. Mô hình tự nhận diện và chuyển giữa 97 ngôn ngữ ngay giữa cuộc hội thoại, gọi công cụ nền mà không ngắt mạch lời nói, và gắn watermark SynthID vô hình vào âm thanh do AI tạo ra. Giá API chỉ 0,005 USD mỗi phút cho âm thanh đầu vào và 0,018 USD cho đầu ra — thấp đến mức việc nói chuyện với phần mềm không còn là tính năng cao cấp.
Cùng tuần đó, OpenAI đưa GPT-Live-1 lên API: hệ thống giọng nói song công có thể nghe và nói đồng thời, giá 0,05 USD mỗi phút. Hai lần ra mắt cạnh tranh khiến khả năng nghe và nói cùng lúc bớt giống điều lạ mắt, và giống năng lực người xây sản phẩm nên tính đến hơn.

Ảnh: Googleplex — Nhiếp ảnh: Grendelkhan, CC BY-SA 3.0, qua Wikimedia Commons
Mẹo thực tế: biến tri thức nói thành thứ bền vững
Giọng nói hữu ích nhất khi nói dễ hơn gõ: lúc đang đi qua một vấn đề, nhìn vào vật trước mặt hoặc chuyển giữa nhiều việc. Hãy đặt sẵn nơi đến cho mỗi quy trình: ghi chú dự án, danh sách việc hay trang tham khảo. Khi kết thúc, ghi lại tóm tắt ngắn và liên kết với ngữ cảnh nguồn.
Người dùng BrainMap có thể xem giọng nói là lớp thu thập nhanh, còn đồ thị tri thức là lớp lưu bền vững. Tách câu hỏi, kết luận và điều chưa chắc thành các ghi chú riêng. Nhờ vậy, bạn giữ được tốc độ của việc nói mà không nhầm câu trả lời trôi chảy với sự thật đã kiểm chứng.
Nguồn: Google, 9to5Google, Tech Insider.
Còn bạn thì sao? Bạn sẽ dùng giọng nói làm cách mặc định để lưu ý tưởng, hay vẫn tin việc gõ phím hơn?
Sẵn sàng sắp xếp tri thức với AI?
BrainMap tự động phân loại ghi chú, khám phá kết nối và xây dựng đồ thị tri thức cá nhân. Miễn phí — không cần thẻ tín dụng.
Dùng thử miễn phíBài viết liên quan

Báo cáo đe dọa của Anthropic và câu hỏi có nên chậm lại
Anthropic cho biết họ đã ngăn chặn việc lạm dụng Claude cho nghiên cứu vũ khí sinh học, gián điệp mạng có liên hệ với Nga nhằm vào Ukraine và trích xuất năng lực của Claude. Một vụ tấn công bị bỏ sót đang làm dấy lên câu hỏi về tốc độ phát triển mô hình.

Siri AI trên iOS 27: Apple đưa ngữ cảnh cá nhân lên trợ lý ngay trên thiết bị
Siri AI beta trên iOS 27 hiểu ngữ cảnh từ email, tin nhắn, lịch, ảnh và ghi chú, với nhận biết màn hình và tác vụ liên ứng dụng.

Claude Fable 5.1: Vòng lặp agent rẻ hơn, an toàn phân tầng
Anthropic phát hành Fable 5.1 và Mythos 5.1 với cùng một model nhưng hai mức bảo vệ, trong khi giá đọc bộ nhớ đệm giảm mạnh làm thay đổi bài toán chi phí của agent chạy dài.