گوگل دو مدل هوش مصنوعی جدید با نامهای جمینای 3.8 لایو و Gemini 3.8 Live Extended Thinking را معرفی کرده است؛ مدلهایی که به گفته این شرکت، پیشرفتهترین مدلهای مکالمه زنده گوگل محسوب میشوند و برای همکاری صوتی، پردازش همزمان ورودیهای تصویری و اجرای وظایف پیچیده از طریق گفتوگو طراحی شدهاند.
مدل Gemini 3.8 Live با تمرکز بر مقیاسپذیری و مدیریت هزینه توسعه یافته و هوش مکالمهای را با ادراک بصری و گفتوگوی روان ترکیب میکند. در مقابل، نسخه Gemini 3.8 Live Extended Thinking برای مسائل پیچیدهتر ساخته شده و بر توان پردازشی بالاتر و استدلال چندمرحلهای تکیه دارد. گوگل این دو مدل را گزینهای برای توسعهدهندگان و مشتریان سازمانی در طراحی ایجنتهای صوتی معرفی کرده است.
بر اساس بررسیهای فنی گوگل، مدل Extended Thinking در شاخص کیفیت صدابهصدا در پایگاه Artificial Analysis با امتیاز ۸۲.۶ رتبه اول را کسب کرده است. این مدل همچنین در بنچمارک τ-Voice امتیاز ۶۸.۶ درصد، در آزمون τ-Voice-banking امتیاز ۳۵.۱ درصد و در آزمون استدلال صوتی Big Bench Audio امتیاز ۹۷.۷ درصد ثبت کرده است.
از قابلیتهای مهم این خانواده، درک سریع ورودیهای تصویری در حین مکالمه، تشخیص خودکار و جابهجایی میان ۹۷ زبان، و اجرای ابزارها و دستورهای نرمافزاری در پسزمینه بدون قطع شدن گفتوگو عنوان شده است. نسخه Extended نیز هنگام حل مسائل دشوار میتواند استدلال و مکالمه را همزمان ادامه دهد و روند پیشرفت را بهصورت صوتی گزارش کند.
گوگل اعلام کرده است که صداهای تولیدشده توسط این سیستمها با فناوری SynthID واترمارک میشوند تا امکان رهگیری اصالت محتوا فراهم باشد. انتشار هر دو مدل نیز آغاز شده است؛ Gemini 3.8 Live از طریق Gemini API، Google AI Studio، پیشنمایش خصوصی Gemini Enterprise و Search Live ارائه میشود و نسخه Extended Thinking نیز برای توسعهدهندگان، مشتریان تجاری Workspace و کاربران جمینای لایو و برخی سرویسهای گوگل در دسترس قرار گرفته است.