گوگل از جدیدترین مدل هوش مصنوعی خود با نام Gemini 3.5 Transcribe رونمایی کرد. این مدل بهطور تخصصی برای تبدیل گفتار به متن طراحی شده و هدف آن ارائه خروجی متنی دقیقتر، روانتر و سریعتر نسبت به نسلهای قبلی است.
عملکرد سریعتر و خطای کمتر
بر اساس اطلاعات منتشر شده، Gemini 3.5 Transcribe نسبت به موتور قبلی گوگل برای تبدیل گفتار به متن یعنی Chirp 3، پیشرفتهای قابل توجهی داشته است. سرعت پردازش صوتی در این مدل جدید حدود ۷۰ درصد افزایش یافته و نرخ خطای آن در شرایط گفتار زنده به ۵.۵ درصد رسیده است. برای مقایسه، نسل قبلی (Chirp 3) نرخ خطای ۷.۳۲ درصدی داشت.
اگرچه تغییر عددی ممکن است ناچیز به نظر برسد، اما کاهش نیاز به ویرایش و تصحیح دستی متن خروجی، تجربه کاربری را بهطور محسوسی بهبود میبخشد. این موضوع بهویژه برای کاربرانی که حجم زیادی از جلسات، مصاحبهها یا محتوای صوتی را تبدیل به متن میکنند، بسیار اهمیت دارد.
حذف کلمات اضافه و تصحیح لحظهای
یکی از ویژگیهای برجسته Gemini 3.5 Transcribe، توانایی حذف کلمات پرکننده و اضافی از متن خروجی است. کلماتی مانند «اِم» و «آه» که بهطور طبیعی در هنگام صحبت کردن بیان میشوند، بهصورت خودکار از متن نهایی حذف خواهند شد. علاوه بر این، این مدل قادر است در صورت تشخیص اشتباه در تشخیص کلمات، متن را بهصورت لحظهای ویرایش و اصلاح کند. همچنین قابلیت استفاده از واژگان سفارشی برای مدیریت اصطلاحات تخصصی و فنی فراهم شده است. این یعنی کاربران میتوانند فهرستی از اصطلاحات خاص حوزه کاری خود را به مدل بدهند تا دقت تشخیص این واژگان افزایش یابد.پشتیبانی از ۸۵ زبان
قابلیتهای Gemini 3.5 Transcribe در ۸۵ زبان مختلف در دسترس خواهد بود. همچنین در فایلهای صوتی از پیش ضبطشده، این مدل توانایی تفکیک و تشخیص صدای حداکثر سه سخنران مجزا را دارد. این ویژگی برای تبدیل متن جلسات گروهی و مصاحبهها بسیار کاربردی است.
ملاحظات و محدودیتها
با وجود تمامی پیشرفتها، کاربران باید توجه داشته باشند که دقت خروجی متنی همچنان به کیفیت صدای ورودی و وضوح گوینده بستگی دارد. در شرایط محیطی نامناسب یا گویشهای خاص، ممکن است نتایج مطلوب حاصل نشود. همچنین با توجه به اتکای مدل به تشخیص دقیق گفتار، تغییر در شیوه بیان میتواند بر کیفیت متن خروجی تأثیرگذار باشد.گوگل با معرفی Gemini 3.5 Transcribe گام دیگری در راستای تقویت ابزارهای هوش مصنوعی خود برداشته است. این مدل جدید بهنظر میرسد جایگزینی جدی برای رقبایی مانند Whisper اوپنایآی در حوزه تبدیل گفتار به متن باشد و میتواند تجربه کاربران در استفاده از ابزارهای تبدیل صدا را بهطور چشمگیری ارتقا دهد.




دیدگاهها (0)
هنوز دیدگاهی ثبت نشده است.