گوگل از جدیدترین مدل هوش مصنوعی خود با نام Gemini 3.5 Transcribe رونمایی کرد. این مدل به‌طور تخصصی برای تبدیل گفتار به متن طراحی شده و هدف آن ارائه خروجی متنی دقیق‌تر، روان‌تر و سریع‌تر نسبت به نسل‌های قبلی است.

داخل خبر (468x60)

عملکرد سریع‌تر و خطای کمتر

Gemini 3.5 Transcribe بر اساس اطلاعات منتشر شده، Gemini 3.5 Transcribe نسبت به موتور قبلی گوگل برای تبدیل گفتار به متن یعنی Chirp 3، پیشرفت‌های قابل توجهی داشته است. سرعت پردازش صوتی در این مدل جدید حدود ۷۰ درصد افزایش یافته و نرخ خطای آن در شرایط گفتار زنده به ۵.۵ درصد رسیده است. برای مقایسه، نسل قبلی (Chirp 3) نرخ خطای ۷.۳۲ درصدی داشت. اگرچه تغییر عددی ممکن است ناچیز به نظر برسد، اما کاهش نیاز به ویرایش و تصحیح دستی متن خروجی، تجربه کاربری را به‌طور محسوسی بهبود می‌بخشد. این موضوع به‌ویژه برای کاربرانی که حجم زیادی از جلسات، مصاحبه‌ها یا محتوای صوتی را تبدیل به متن می‌کنند، بسیار اهمیت دارد.

حذف کلمات اضافه و تصحیح لحظه‌ای

یکی از ویژگی‌های برجسته Gemini 3.5 Transcribe، توانایی حذف کلمات پرکننده و اضافی از متن خروجی است. کلماتی مانند «اِم» و «آه» که به‌طور طبیعی در هنگام صحبت کردن بیان می‌شوند، به‌صورت خودکار از متن نهایی حذف خواهند شد. علاوه بر این، این مدل قادر است در صورت تشخیص اشتباه در تشخیص کلمات، متن را به‌صورت لحظه‌ای ویرایش و اصلاح کند. همچنین قابلیت استفاده از واژگان سفارشی برای مدیریت اصطلاحات تخصصی و فنی فراهم شده است. این یعنی کاربران می‌توانند فهرستی از اصطلاحات خاص حوزه کاری خود را به مدل بدهند تا دقت تشخیص این واژگان افزایش یابد.

پشتیبانی از ۸۵ زبان

Gemini 3.5 Transcribe voice to text قابلیت‌های Gemini 3.5 Transcribe در ۸۵ زبان مختلف در دسترس خواهد بود. همچنین در فایل‌های صوتی از پیش ضبط‌شده، این مدل توانایی تفکیک و تشخیص صدای حداکثر سه سخنران مجزا را دارد. این ویژگی برای تبدیل متن جلسات گروهی و مصاحبه‌ها بسیار کاربردی است.

ملاحظات و محدودیت‌ها

با وجود تمامی پیشرفت‌ها، کاربران باید توجه داشته باشند که دقت خروجی متنی همچنان به کیفیت صدای ورودی و وضوح گوینده بستگی دارد. در شرایط محیطی نامناسب یا گویش‌های خاص، ممکن است نتایج مطلوب حاصل نشود. همچنین با توجه به اتکای مدل به تشخیص دقیق گفتار، تغییر در شیوه بیان می‌تواند بر کیفیت متن خروجی تأثیرگذار باشد.

گوگل با معرفی Gemini 3.5 Transcribe گام دیگری در راستای تقویت ابزارهای هوش مصنوعی خود برداشته است. این مدل جدید به‌نظر می‌رسد جایگزینی جدی برای رقبایی مانند Whisper اوپن‌ای‌آی در حوزه تبدیل گفتار به متن باشد و می‌تواند تجربه کاربران در استفاده از ابزارهای تبدیل صدا را به‌طور چشمگیری ارتقا دهد.