Программисты
дистанционно
договорная
Data Science. Разработка с нуля. Требуется создать систему автоматического формирования субтитров на основе аудио и видео материалов с использованием технологий искусственного интеллекта. Ориентиры - существующие сервисы speech2text.ru и any2text.ru, но задача - сделать продукт не хуже, а по ряду параметров лучше (расширенный функционал, гибкость, безопасность). Система должна работать как в онлайн-режиме (веб-сервис), так и в офлайн-режиме (локальная программа или self-hosted решение) для работы с конфиденциальными данными. Рассматриваются как готовые решения с доработкой, так и разработка с нуля. Основные функции системы: Автоматическое распознавание речи (ASR): Поддержка русского и иностранных языков (минимум 5–10 популярных). Высокая точность, возможность дообучения под специфическую лексику (историческую, техническую, кинематографическую). Учет контекста через промпты (до 250 слов). Разделение дикторов (Speaker Diarization): Автоматическое определение смены говорящего, присвоение идентификаторов (Мужчина 1, Женщина 1, Группа и т.д.). Возможность ручного переименования спикеров. Распознавание текста на видеоизображении (OCR): Детекция и оцифровка надписей, титров, вывесок. Классификация: диалог, экранный текст, титры. Возможность включать/исключать распознанные надписи в итоговый файл. Машинный перевод (MT): Автоматический перевод субтитров на минимум 14 языков. Сохранение таймкодов и структурной привязки текста (alignment). Учет культурных и исторических особенностей. Встроенный веб-редактор: Двухпанельный режим (оригинал/перевод, черновик/правка). Видеоплеер с покадровой навигацией. Управление таймкодами, разделение/объединение сегментов. Проверка орфографии, поиск и замена. Поддержка версионности (история изменений, откат). Экспорт субтитров: Форматы: SRT, VTT, JSON, XML, DOC/DOCX, ODT, TXT, STL (EBU). Диалоговые листы в Word. Возможность встраивания субтитров в видеофайл. Дополнительно (желательно): Загрузка диалоговых листов (сканы, текст) для повышения точности ASR. Автоматическая проверка соблюдения стандартов субтитрирования (ГОСТ, EBU). Работа в изолированном контуре без доступа в интернет. Технические требования: Использование современных open-source моделей: Whisper (faster-whisper), pyannote.audio, Helsinki-NLP и др. Возможность развертывания на сервере заказчика (on-premise) или в облаке (РФ). Веб-интерфейс (React/Vue + Python/FastAPI/Node.js). Поддержка GPU для ускорения обработки. Передача исходного кода и прав на использование. Ожидаемый результат: Работающий прототип (MVP) с базовым функционалом ASR + экспорт SRT. Полноценная система с редактором, диаризацией, переводом и OCR. Документация (руководство пользователя и администратора). Рассматриваю как отдельных специалистов, так и команды/студии. Как откликнуться: В отклике укажите: Ваш опыт в разработке ASR/ML-систем. Примеры похожих проектов (если есть). Предлагаемый стек технологий. Оценку сроков и стоимости (хотя бы вилку). Готовы ли работать с передачей исходного кода.
2026-10-04
Откликнуться