Добрый день!
Есть ли ИИ система для озвучки игры?
Например у меня есть файл с озвучкой программистом. Который эмоциональный и точный. Но нужно чтобы примерно так же голос звучал в стиле худой старик 70 лет и толстый мужик 40 лет и.т.д
К примеру есть файл где кто то кричит:
"на нас напали"!
А ИИ сделает несколько вариантов этой фразы и еще на разных языках и в точности передаст эмоции (в том числе крик, истерика и.т.д)?
А что сами нейросети говорят на этот счет?
Конечно не умеют :(
Вот что пишет Koda.
Вот задание:
Вот поэтому мы человеки есть высшие создания, у нас встроены генераторы звуков и есть навыки рисования. А когда ИИ к этому приблизиться, чтобы выполнить такие простые вещи, не понятно. Даже чтобы 10 секундное видео сгенерить надо потратить 5000 рублей и кучу серверных ресурсов. А чтобы пере озвучить 1000 звуковых файлов на разных языках, потребуется вручную с каждым файлом работать. А болтовни про этот ИИ дофига.
manking ты просишь текстовую LLM озвучить текст)
Ищи нейросети для работы со звуком. В ComfyUI посмотри примеры.
Blueprint
А почему бы текстовой LLM не найти все что нужно и сделать всю работу? Они вроде как и игры могут создавать. А в играх графика и звук откуда берется?
Я то ищу ИИ который за меня проведет самую сложную работу. Иначе придется работать с каждым файлом индивидуально.
manking
> А почему бы текстовой LLM не найти все что нужно и сделать всю работу?
Потому, что ты не догадался спросить даже у базовой гугловской какие есть для этого инструменты?
Для массовой многоязычной озвучки или видеодубляжа лучше всего использовать специализированные ИИ-платформы, а не базовые генераторы текста. Они автоматически переводят сценарий, клонируют оригинальный тембр голоса и подбирают липсинк.
Лучшими решениями на 2026 год признаны:
ElevenLabs: Безусловный лидер по качеству клонирования голоса. Функция автоматического перевода и дубляжа (Dubbing v2) поддерживает более 90 языков, сохраняя оригинальные эмоции и интонации спикера.
Rask.ai: Топовый инструмент для массовой локализации видео. Идеально подходит для работы с несколькими говорящими лицами в кадре, автоматически генерирует субтитры и синхронизирует губы (Lip-Sync) на 30+ языках.
CAMB.AI: Платформа, поддерживающая более 150 языков. Отличается по-настоящему качественным трансфером эмоций, что важно для авторских подкастов и фильмов.
Synthesia: Позволяет обрабатывать контент на 140+ языках с региональными диалектами, предлагая полный цикл перевода от текста до готового видео.
Если вам требуется лишь профессиональный закадровый голос без перевода видеоряда, обратите внимание на мультиязычные библиотеки ElevenLabs Voice Library. Для решения специфических бизнес-задач также можно использовать многоязычный генератор закадрового голоса Speaktor или Jenova.ai.
Теперь вопрос: Какие из них работают с Россией? Или нужно использовать обходные пути оплаты сервиса?
elcar
> ElevenLabs
Так он ерунду пишет.
Я зашел на сайт
https://studio.camb.ai/
Там нет нигде audio to audio инструментов. Только text to audio.
А ElevenLabs блокирует запрос из РФ.
Опять же ИИ идиоты (их ответ не верный). Меня интересует мнение людей кто реально пользовался инструментом генерации профессиональной озвучки из любительской.
Насколько я понимаю сейчас такого инструмента нет. Есть инструменты генерации аудио из текста, есть голосовые движки. А вот чтобы взять аудио файл и сгенерировать из него такой же файл с такими же эмоциями, но определенными чертами голоса, вот это сейчас ИИ не умеет.
так это делается через звуковые редакторы, не?
OnzaRain
Да, можно вручную сделать через редактор или найти актеров озвучки. Но сейчас эра ИИ, я бы хотел найти кодового агента который бы взял проект и сам переозвучил бы файлы с фразами учитывая какие персонажи их произносят и еще бы перевел эти фразы на другие языки сохранив все эмоции.
Это бы мне сильно помогло. Перевод текста проекта в принципе кодовый агент сделал, а с озвучкой у него какие то проблемы.
manking
> audio to audio
voice-to-voice мб?
manking
> Есть ли ИИ система для озвучки игры?
VoxCPM2. Клонирует голос из образца. Эмоции кодируются через текстовые тэги.
ComfiUI желателен, но не обязателен. Для беглого ознакомления можно взять Pinokio.
Да, она голос берёт только за образец, и аудио генерирует своё. Оно даже к лучшему, т.к. условный старик может медленнее слова проговаривать.
Если прям по запросу конвертации тембра голоса на другое аудио - Cosy Voice 3.0.
manking
> Вот что пишет Koda.
Чел, тебе бесплатно в браузере доступны ChatGPT, Claude, DeepSeek V4, Qwen, Kimi, все с поиском по интернету. Какая к чёрту Koda?
Если у тебя была задача поискать (как факт работы) и не найти - то ты великолепен. Только таким макаром кашу не сваришь.
Попробовал elevenlabs.io. Voice changer.
Для текущей задачи моей справляется на 3 с минусом. Пока сойдет. Цена низкая.
Сами голоса понравились, но вот перевод эмоций плохой.
Если переводить текст то проблем не будет, хорошо переводит, а вот сильные эмоции, вздохи ахи, не умеет. Тем более по киношному с криком когда персонаж в крови.
Например передал такой текст, чтобы он с ужасом орал от испуга будучи раненым. А он слегка увеличив голос просто говорит, вместо того чтобы по киношному орать чтобы в голосе чувствовался ужас. Я так понял сильные эмоции пока модели передавать не способны.
Фраза с тэгами для elevenlabs:
Dan398
> > Вот что пишет Koda.
> Чел, тебе бесплатно в браузере доступны ChatGPT, Claude, DeepSeek V4, Qwen, Kimi, все с поиском по интернету. Какая к чёрту Koda?
> Если у тебя была задача поискать (как факт работы) и не найти - то ты великолепен. Только таким макаром кашу не сваришь.
Вообще то Koda умный. Он мне конвертер сделал чтобы MP3 в WAV переводить и в нужную папку копировать. Он мне сэкономил 5 часов на каждого персонажа. Чтобы вручную не конвертировать.
manking
> Он мне конвертер сделал чтобы MP3 в WAV переводить и в нужную папку копировать
Бесплатный конвертер аудио файлов в составе бесплатного плеера AIMP чем не устроил?