گوگل نسل تازهای از مدلهای هوش مصنوعی صوتی خود را با نام Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking معرفی کرد. این دو مدل با هدف ارتقای کیفیت گفتوگوی صوتی، تقویت توان استدلال و فراهمکردن بستری قابل اتکا برای ساخت عاملهای صوتی (Voice Agents) توسعه یافتهاند و قرار است تعامل با دستیار جمنای، گوگل ورکاسپیس و جستوجوی گوگل را روانتر و کارآمدتر کنند.
بر اساس اعلام رسمی گوگل، تمرکز اصلی این بهروزرسانی بر سادهسازی تعامل صوتی است؛ بهگونهای که کاربر بتواند صرفاً با صدای خود، وظایف پیچیده و چندمرحلهای را پیش ببرد، در حالی که مدل در پسزمینه ابزارها و APIها را اجرا میکند و رشته گفتوگو قطع نمیشود.
دو مدل با دو مأموریت متفاوت
گوگل تأکید میکند که دو مدل جدید، نقشهای مکملی دارند. Gemini 3.8 Live با رویکرد مقیاسپذیری و بهینهسازی هزینه طراحی شده و ترکیبی از هوش مکالمهای، گفتوگوی طبیعی و درک بصری را ارائه میدهد. این مدل برای استفاده گسترده و پاسخگویی سریع در سناریوهای روزمره بهینه شده است.
در مقابل، Gemini 3.8 Live Extended Thinking برای مأموریتهای دشوارتر ساخته شده است. نقطه قوت این نسخه، استدلال چندمرحلهای و سطح بالاتری از هوش تحلیلی است؛ مدلی که میتواند مسائل پیچیده را مرحله به مرحله حل کند و در عین حال کیفیت مکالمه را حفظ نماید.
هر دو مدل بهعنوان بلوکهای سازنده عاملهای صوتی آماده تولید (Production-ready) معرفی شدهاند؛ به این معنا که توسعهدهندگان میتوانند با آنها سامانههایی بسازند که هم پاسخگویی دقیق دارند، هم پیوستگی و انسجام گفتوگو را حفظ میکنند و هم قادر به تعامل پایدار با ابزارها و سرویسهای خارجی هستند.

رکوردشکنی در بنچمارکهای صوتی و عاملی
گوگل برای نمایش توان نسخه Extended Thinking، نتایج چند بنچمارک معتبر را منتشر کرده است. در شاخص Artificial Analysis Speech to Speech Quality Index که کیفیت تبدیل گفتار به گفتار را میسنجد، این مدل با امتیاز ۸۲.۶ در صدر جدول ایستاده است.
در بنچمارک τ-Voice که توانایی انجام وظایف عاملمحور را ارزیابی میکند، امتیاز ۶۸.۶ درصد و در نسخه تخصصی بانکی آن یعنی Sierra's τ-Voice-banking امتیاز ۳۵.۱ درصد به ثبت رسیده است. همچنین در Big Bench Audio نیز مدل جدید امتیاز خیرهکننده ۹۷.۷ درصد را کسب کرده است.

گوگل تأکید دارد که این نتایج در کنار حفظ قیمت رقابتی نسبت به سایر مدلهای مرزی (Frontier) به دست آمده و از نظر اقتصادی نیز برای توسعهدهندگان بهصرفه است.

در بنچمارک سازمانی ServiceNow's EVA-Bench نیز هر دو مدل Live مرز کارایی پارتو را برای گردشکارهای پیچیده جابهجا کردهاند؛ ترکیبی از دقت بالا و کیفیت مکالمه که برای عاملهای سازمانی و پشتیبانی مشتری حیاتی است.

درک بصری آنی و پشتیبانی از ۹۷ زبان
یکی از قابلیتهای کلیدی Gemini 3.8 Live، پردازش تقریباً آنی ورودیهای بصری است. این ویژگی بافت و زمینه بیشتری به مکالمه میافزاید؛ برای مثال مدل میتواند آنچه را از طریق دوربین میبیند بهصورت همزمان تحلیل و در گفتوگو استفاده کند.
همچنین این مدل از ۹۷ زبان پشتیبانی میکند و میتواند در میانه یک مکالمه بهطور خودکار زبان را تشخیص داده و تغییر دهد، بدون آنکه کاربر نیازی به تنظیم دستی داشته باشد. اجرای ابزارها و فراخوانی APIها نیز کاملاً در پسزمینه انجام میشود و جریان گفتوگو بدون مکث ادامه مییابد.

تفکر و گفتوگو بهصورت همزمان
مهمترین تمایز نسخه Extended Thinking، توانایی «فکر کردن و صحبت کردن همزمان» است. گوگل توضیح میدهد که این مدل برای جلوگیری از سکوتهای طولانی در هنگام پردازشهای پیچیده، از نشانههای کلامی طبیعی مانند «صبر کن بررسی کنم» استفاده میکند تا به کاربر اطمینان دهد درخواستش دریافت شده است.
سپس در حین انجام مراحل مختلف یک وظیفه چندمرحلهای، با روایت زنده پیشرفت کار، کاربر را در جریان قرار میدهد. نتیجه، تجربهای است که ریتم طبیعی گفتوگو را حتی در پیچیدهترین گردشکارها حفظ میکند و حس انتظار را کاهش میدهد.
نشانهگذاری صوتی با SynthID برای مقابله با جعل
در بخش مسئولیتپذیری، گوگل اعلام کرده که تمام صداهای تولید شده توسط محصولات هوش مصنوعی این شرکت با فناوری SynthID نشانهگذاری میشوند. این نشان نامحسوس بهصورت مستقیم در موج صوتی خروجی تنیده میشود تا محتوای تولیدشده توسط هوش مصنوعی قابل شناسایی بماند و خطر انتشار اطلاعات نادرست یا جعل صوتی کاهش یابد.
زمان عرضه و دسترسی
هر دو مدل از امروز عرضه شدهاند. برای توسعهدهندگان، دسترسی از طریق Gemini API و Google AI Studio فراهم است. سازمانها میتوانند نسخه پیشنمایش خصوصی را در Gemini Enterprise تجربه کنند که بهزودی به Gemini Enterprise for Customer Experience نیز گسترش مییابد. برای کاربران عمومی، مدل Live در قابلیت Search Live فعال شده است.
نسخه Extended Thinking نیز از همین امروز در دسترس قرار گرفته و علاوه بر مسیر توسعهدهندگان، برای سازمانها در Gemini Enterprise و مشتریان تجاری Google Workspace ارائه میشود. کاربران عادی نیز میتوانند آن را در Gemini Live و مشترکان طرحهای Google AI Pro و Ultra در Workspace تجربه کنند.
با این رونمایی، گوگل گام دیگری برای تبدیل دستیار صوتی به یک عامل هوشمند و قابل اعتماد برداشته است؛ عاملی که نهتنها پاسخ میدهد، بلکه میاندیشد، ابزارها را بهکار میگیرد و در تمام این مدت، گفتوگو را زنده و انسانی نگه میدارد.




دیدگاهها (0)
هنوز دیدگاهی ثبت نشده است.