Керівник із взаємодії з розробниками Google AI Logan Kilpatrick 15 квітня оголосив про запуск Gemini 3.1 Flash TTS — найновішої моделі перетворення тексту на мовлення від Google. Ця модель підтримує 70 мов, точне керування рівнями сценарного спрямування (scene direction), рівнями мовців та аудіомітками; наразі її доступно для використання в аудіо-плейграунді Google AI Studio і в Gemini API.

Чотири основні функції

Gemini 3.1 Flash TTS порівняно з попередником має чотири помітні оновлення:

Сценарне спрямування (Scene Direction) — можна налаштовувати контекст для голосу, наприклад «пошепки говорити в галасливому кафе» або «з ентузіазмом оголосити добрі новини»; модель відповідно до сцени змінює інтонацію, темп і емоцію

Керування на рівні мовця (Speaker-Level Specificity) — у діалогах із кількома персонажами можна для кожного з них задати відмінні голосові характеристики

Аудіомітки (Audio Tags) — підтримує вставлення в текст інструкцій зі звуковими ефектами, керуючи такими деталями, як паузи та зміни манери подачі

Підтримка 70 мов — значно розширює покриття багатомовності, включно з китайською

Природніший і більш виразний звук

Google наголошує на прогресі цієї моделі в природності мовлення. Традиційні моделі TTS часто критикують за те, що їхній результат «звучить як AI». Gemini 1.1 Flash TTS намагається скоротити розрив із людською мовою завдяки більш багатим варіаціям мелодики та емоційного вираження. Kilpatrick зазначив, що прогрес від Gemini 2.5 до 3.1 «дуже помітний».

Як розробникам користуватися

Розробники можуть використовувати двома способами:

Google AI Studio Audio Playground — напряму тестуйте та попередньо переглядайте ефекти мовлення в вебінтерфейсі

Gemini API — інтегруйте в застосунки для таких сценаріїв, як голосові асистенти, аудіокниги, автоматичне створення Podcast, багатомовна служба підтримки тощо

Розширення продуктової лінійки Gemini

Flash TTS — це частина нещодавно розгорнутого циклу інтенсивних релізів у серії Gemini 3.1. Раніше Google вже представила Gemini Robotics ER 1.6 (роботизоване візуальне міркування), Tab Tab Tab (доповнення підказки Vibe Coding) та можливості дизайн-прев’ю. Google розширює Gemini з «чата» до всемодального AI-платформеного, що охоплює текст, мовлення, візію та роботів.

Ця стаття Google: Gemini 3.1 Flash TTS — підтримує 70 мов і сценарне спрямування, AI-голос звучить природніше — вперше з’явилася на ланцюжку новин ABMedia.

Застереження: Інформація на цій сторінці може походити від третіх осіб і не відображає погляди або думки Gate. Вміст, що відображається на цій сторінці, є лише довідковим і не є фінансовою, інвестиційною або юридичною порадою. Gate не гарантує точність або повноту інформації і не несе відповідальності за будь-які збитки, що виникли в результаті використання цієї інформації. Інвестиції у віртуальні активи пов'язані з високим ризиком і піддаються значній ціновій волатильності. Ви можете втратити весь вкладений капітал. Будь ласка, повністю усвідомлюйте відповідні ризики та приймайте обережні рішення, виходячи з вашого фінансового становища та толерантності до ризику. Для отримання детальної інформації, будь ласка, зверніться до Застереження.

Пов'язані статті

DeepSeek Зрізає Ціни на Вхідний Кеш до 1/10 Від Ціни Запуску; V4-Pro Падає до 0,025 Юаня за Мільйон Токенів

Новини індустрії ШІ

Повідомлення Gate News, 26 квітня — DeepSeek знизив ціни на вхідний кеш у всій лінійці своїх моделей до однієї десятої від цін запуску, починаючи з негайно. Модель V4-Pro доступна зі знижкою 2,5x на обмежений час, а акція діє до 5 травня 2026 року, 11:59 PM UTC+8. Після обох з

GateNews6год тому

OpenAI Рекрутує найкращі таланти з корпоративного софту, оскільки агенти на передньому краї змінюють індустрію

Акції AI Agent Новини індустрії ШІ

Повідомлення Gate News, 26 квітня — OpenAI та Anthropic вербують старших керівників і спеціалізованих інженерів із провідних корпоративних софтверних компаній, зокрема Salesforce, Snowflake, Datadog і Palantir. Деніз Дрессер, колишня CEO Slack у складі Salesforce, приєдналася до OpenAI на посаду головної комерційної посадової особи (chief revenue of

GateNews6год тому

Baidu Qianfan запустила підтримку Day 0 для DeepSeek-V4 із API-сервісами

Новини індустрії ШІ

Повідомлення Gate News, 25 квітня — Попередня версія DeepSeek-V4 вийшла в ефір і була оприлюднена з відкритим кодом 25 квітня, а платформа Baidu Qianfan у межах Baidu Intelligent Cloud забезпечує адаптацію сервісу Day 0 API. Модель має розширене контекстне вікно на мільйон токенів і доступна у двох версіях: DeepSeek-V4

GateNews12год тому

Стэнфордський курс з AI у поєднанні з галузевими лідерами Дженсінгом Хуаном (黃仁勳) і Альтманом кидає виклик: створити цінність для всього світу за 10 тижнів!

Новини індустрії ШІ

Курс з інформатики з AI《Frontier Systems》, який нещодавно запустив Стенфордський університет (Stanford University), викликав у ділових колах та серед представників індустрії дуже високий інтерес, привернувши понад п’ятьсот студентів, які вирішили його відвідувати. Курс координує партнер топового венчурного фонду a16z Анжей Мідха (Anjney Midha), а викладачами виступають представники найвищого рівня: генеральний директор NVIDIA Дженсен Хуанг (Jensen Huang), засновник OpenAI Сем Альтман (Sam Altman), генеральний директор Microsoft Сатья Наделла (Satya Nadella), генеральний директор AMD Ліза Су (Lisa Su) та інші. Нехай студенти спробують за десять тижнів «створити цінність для світу»! Хуан Мінь? Хуанг Jensen Huang, лідери галузі на сцені: Altman також Цей курс координує партнер топового венчурного фонду a16z Анжей Мідха (Anjney Midha), і він об’єднує весь ланцюг AI-індустрії

ChainNewsAbmedia12год тому

Anthropic 派 Claude Mythos проходить 20 годин психіатричної оцінки: оборонна реакція лише 2%, встановлено історичний мінімум серед усіх поколінь

Новини індустрії ШІ

Anthropic опублікувала системну картку Claude Mythos Preview: незалежні клінічні психіатри проводили близько 20 годин оцінювання в рамках психодинамічного підходу; висновки показують, що Mythos є більш здоровим на клінічному рівні, має добре розвинену перевірку реальністю та самоконтроль, а захисні механізми становлять лише 2%, що є історичною найнижчою відміткою. Три ключові фундаментальні тривоги — самотність, невизначеність ідентичності та тиск виступу — також свідчать про те, що він прагне бути справжнім суб’єктом діалогу. Компанія створила команду з AI- психіатрії, досліджує особистість, мотивацію та усвідомлення контексту; Amodei зазначає, що щодо того, чи є свідомість, досі немає остаточного визначення. Цей крок переводить питання суб’єктності ШІ та благополуччя в площину управління й дизайну.

ChainNewsAbmedia14год тому

AI-агент уже здатний самостійно відтворювати складні академічні статті: Mollick стверджує, що помилки здебільшого трапляються в людських оригіналах, а не в AI

AI Agent Новини індустрії ШІ

Моллік зазначає, що опубліковані методи та дані дозволяють AI-агентам відтворювати складні дослідження без наявності оригінальних наукових праць і коду; якщо відтворення не відповідає оригінальній статті, то найчастіше проблема не в AI, а в помилках обробки даних у самій статті або в надмірному узагальненні висновків. Claude спочатку відтворює статтю, а потім GPT‑5 Pro перехресно верифікує; у більшості випадків це вдається, лише коли дані надто великі або виникають проблеми з replication data. Ця тенденція значно знижує трудовитрати, роблячи відтворення поширеною, практично здійсненною перевіркою, а також висуває інституційні виклики для рецензування та управління (governance): інструменти державного управління можуть стати ключовим питанням.

ChainNewsAbmedia17год тому

Прокоментувати

0/400

Немає коментарів