گوگل نسل تازه‌ای از مدل‌های هوش مصنوعی صوتی خود را با نام Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking معرفی کرد. این دو مدل با هدف ارتقای کیفیت گفت‌وگوی صوتی، تقویت توان استدلال و فراهم‌کردن بستری قابل اتکا برای ساخت عامل‌های صوتی (Voice Agents) توسعه یافته‌اند و قرار است تعامل با دستیار جمنای، گوگل ورک‌اسپیس و جست‌وجوی گوگل را روان‌تر و کارآمدتر کنند.

بر اساس اعلام رسمی گوگل، تمرکز اصلی این به‌روزرسانی بر ساده‌سازی تعامل صوتی است؛ به‌گونه‌ای که کاربر بتواند صرفاً با صدای خود، وظایف پیچیده و چندمرحله‌ای را پیش ببرد، در حالی که مدل در پس‌زمینه ابزارها و APIها را اجرا می‌کند و رشته گفت‌وگو قطع نمی‌شود.

دو مدل با دو مأموریت متفاوت

گوگل تأکید می‌کند که دو مدل جدید، نقش‌های مکملی دارند. Gemini 3.8 Live با رویکرد مقیاس‌پذیری و بهینه‌سازی هزینه طراحی شده و ترکیبی از هوش مکالمه‌ای، گفت‌وگوی طبیعی و درک بصری را ارائه می‌دهد. این مدل برای استفاده گسترده و پاسخ‌گویی سریع در سناریوهای روزمره بهینه شده است.

در مقابل، Gemini 3.8 Live Extended Thinking برای مأموریت‌های دشوارتر ساخته شده است. نقطه قوت این نسخه، استدلال چندمرحله‌ای و سطح بالاتری از هوش تحلیلی است؛ مدلی که می‌تواند مسائل پیچیده را مرحله به مرحله حل کند و در عین حال کیفیت مکالمه را حفظ نماید.

هر دو مدل به‌عنوان بلوک‌های سازنده عامل‌های صوتی آماده تولید (Production-ready) معرفی شده‌اند؛ به این معنا که توسعه‌دهندگان می‌توانند با آن‌ها سامانه‌هایی بسازند که هم پاسخ‌گویی دقیق دارند، هم پیوستگی و انسجام گفت‌وگو را حفظ می‌کنند و هم قادر به تعامل پایدار با ابزارها و سرویس‌های خارجی هستند.

نمودار مقایسه کیفیت گفتار به گفتار مدل‌های هوش مصنوعی

رکوردشکنی در بنچمارک‌های صوتی و عاملی

گوگل برای نمایش توان نسخه Extended Thinking، نتایج چند بنچمارک معتبر را منتشر کرده است. در شاخص Artificial Analysis Speech to Speech Quality Index که کیفیت تبدیل گفتار به گفتار را می‌سنجد، این مدل با امتیاز ۸۲.۶ در صدر جدول ایستاده است.

در بنچمارک τ-Voice که توانایی انجام وظایف عامل‌محور را ارزیابی می‌کند، امتیاز ۶۸.۶ درصد و در نسخه تخصصی بانکی آن یعنی Sierra's τ-Voice-banking امتیاز ۳۵.۱ درصد به ثبت رسیده است. همچنین در Big Bench Audio نیز مدل جدید امتیاز خیره‌کننده ۹۷.۷ درصد را کسب کرده است.

نمودار مقایسه عملکرد عامل‌های هوش مصنوعی

گوگل تأکید دارد که این نتایج در کنار حفظ قیمت رقابتی نسبت به سایر مدل‌های مرزی (Frontier) به دست آمده و از نظر اقتصادی نیز برای توسعه‌دهندگان به‌صرفه است.

مقایسه عملکرد مدل‌ها در رده‌بندی بانکی Sierra

در بنچمارک سازمانی ServiceNow's EVA-Bench نیز هر دو مدل Live مرز کارایی پارتو را برای گردش‌کارهای پیچیده جابه‌جا کرده‌اند؛ ترکیبی از دقت بالا و کیفیت مکالمه که برای عامل‌های سازمانی و پشتیبانی مشتری حیاتی است.

داخل خبر (468x60)
مقایسه هزینه پردازش ورودی صوتی در مدل‌های مختلف

درک بصری آنی و پشتیبانی از ۹۷ زبان

یکی از قابلیت‌های کلیدی Gemini 3.8 Live، پردازش تقریباً آنی ورودی‌های بصری است. این ویژگی بافت و زمینه بیشتری به مکالمه می‌افزاید؛ برای مثال مدل می‌تواند آنچه را از طریق دوربین می‌بیند به‌صورت هم‌زمان تحلیل و در گفت‌وگو استفاده کند.

همچنین این مدل از ۹۷ زبان پشتیبانی می‌کند و می‌تواند در میانه یک مکالمه به‌طور خودکار زبان را تشخیص داده و تغییر دهد، بدون آنکه کاربر نیازی به تنظیم دستی داشته باشد. اجرای ابزارها و فراخوانی APIها نیز کاملاً در پس‌زمینه انجام می‌شود و جریان گفت‌وگو بدون مکث ادامه می‌یابد.

نمودار مقایسه دقت و تجربه کاربری در بنچمارک EVA

تفکر و گفت‌وگو به‌صورت هم‌زمان

مهم‌ترین تمایز نسخه Extended Thinking، توانایی «فکر کردن و صحبت کردن هم‌زمان» است. گوگل توضیح می‌دهد که این مدل برای جلوگیری از سکوت‌های طولانی در هنگام پردازش‌های پیچیده، از نشانه‌های کلامی طبیعی مانند «صبر کن بررسی کنم» استفاده می‌کند تا به کاربر اطمینان دهد درخواستش دریافت شده است.

سپس در حین انجام مراحل مختلف یک وظیفه چندمرحله‌ای، با روایت زنده پیشرفت کار، کاربر را در جریان قرار می‌دهد. نتیجه، تجربه‌ای است که ریتم طبیعی گفت‌وگو را حتی در پیچیده‌ترین گردش‌کارها حفظ می‌کند و حس انتظار را کاهش می‌دهد.

نشانه‌گذاری صوتی با SynthID برای مقابله با جعل

در بخش مسئولیت‌پذیری، گوگل اعلام کرده که تمام صداهای تولید شده توسط محصولات هوش مصنوعی این شرکت با فناوری SynthID نشانه‌گذاری می‌شوند. این نشان نامحسوس به‌صورت مستقیم در موج صوتی خروجی تنیده می‌شود تا محتوای تولیدشده توسط هوش مصنوعی قابل شناسایی بماند و خطر انتشار اطلاعات نادرست یا جعل صوتی کاهش یابد.

زمان عرضه و دسترسی

هر دو مدل از امروز عرضه شده‌اند. برای توسعه‌دهندگان، دسترسی از طریق Gemini API و Google AI Studio فراهم است. سازمان‌ها می‌توانند نسخه پیش‌نمایش خصوصی را در Gemini Enterprise تجربه کنند که به‌زودی به Gemini Enterprise for Customer Experience نیز گسترش می‌یابد. برای کاربران عمومی، مدل Live در قابلیت Search Live فعال شده است.

نسخه Extended Thinking نیز از همین امروز در دسترس قرار گرفته و علاوه بر مسیر توسعه‌دهندگان، برای سازمان‌ها در Gemini Enterprise و مشتریان تجاری Google Workspace ارائه می‌شود. کاربران عادی نیز می‌توانند آن را در Gemini Live و مشترکان طرح‌های Google AI Pro و Ultra در Workspace تجربه کنند.

با این رونمایی، گوگل گام دیگری برای تبدیل دستیار صوتی به یک عامل هوشمند و قابل اعتماد برداشته است؛ عاملی که نه‌تنها پاسخ می‌دهد، بلکه می‌اندیشد، ابزارها را به‌کار می‌گیرد و در تمام این مدت، گفت‌وگو را زنده و انسانی نگه می‌دارد.