Вход Блог
Строительство и ремонт
Репетиторы
Красота
Фрилансеры
Разные специалисты
Уход за животными
Тренеры
Автоинструкторы

Data scientist — удалённая работа в Москве

Дата: 2022-09-07
Детали
Регион
Москва
Занятость
дистанционно
Стоимость
от 1000.00 руб.
Дата публикации
2022-09-07
Описание
Анализ собранных данных. Прикладываю ссылку на ТЗ: https://docs.google.com/document/d/1MZ6wdGb-z5rw9d_B6Kr1B9MKCr-BPwIA/edit Нужен обязательно ИП или самозанятый, так как оплата услуг будет от Юр. лица.
Похожие заказы

Data scientist

дистанционно
договорная
Настройка, доработка существующего продукта. Нам нужно выстроить оптимальную аналитику данных по нескольким проектам. Есть небольшое количество разных данных по 3 проектам. В эти проекты попадают данные из Wb, Ozon, ПланФакт, Банки, Google-таблицы, 1С. Нужно помочь со следующими задачами: - Аккуратно переструктурировать данные по таблицам - Сформировать слой VIEW в ClickHouse - Собрать понятную короткую документацию по данным и архитектуре - Проверить на корректность загрузки данных с источников - Выстроить оптимальные дашборды в Metabase (тут будем обсуждать подробнее и периодически дополнять) Стэк: ClickHouse, Python, Metabase Оплату готов обсуждать почасово, либо разбивать на небольшие проекты и двигаться в таком формате. Нужен человек в долгую работу с частичным участием по запросу. Сейчас задач много и надо погрузиться, разгрести накопившееся Знание ClickHouse и Python обязательно.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Пожелания и особенности: Разработка программы для распознавания информации из файлов пдф и перенос этой информации структурировано в эксель таблицу.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Разработка OLap кубов на SQL, разработка дашбордов Power BI, DAX.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля, доработка существующего продукта. Ищу Python/LLM-разработчика для создания MVP AI-системы для генеалогических исследований. Система должна анализировать массив архивных документов по человеку и формировать: 1. Генеалогическое досье – связную насыщенную биографию, родственные связи, хронологию, источники и реальные противоречия; 2. Исследовательский слой – анализировать каждый значимый факт и совокупность фактов, выявлять пробелы, формировать обоснованные генеалогические гипотезы и конкретные направления дальнейшего поиска. Например, система должна не просто видеть «место рождения неизвестно», а понимать, что можно установить дальше, зачем это нужно для родословной, какое свидетельство необходимо, где оно может находиться, что изменится при подтверждении/опровержении и куда двигаться при отрицательном результате. Важно сразу проектировать ядро с возможностью дальнейшего развития: - автоматический поиск по архивным каталогам и историческим/генеалогическим онлайн-базам; - работа с фондами, описями и архивными маршрутами; - учёт уже выполненных запросов и отрицательных результатов; - чат по конкретной персоне с опорой на источники; - автоматическая сборка и вёрстка семейной книги из досье, документов, фотографий и древа. На первом этапе всё это реализовывать не требуется — нужен рабочий MVP ядра, но архитектура не должна создавать тупик для дальнейшего развития. Критично: не терять биографически значимую информацию, не смешивать разных людей, сохранять связь выводов с источниками, отличать OCR/описки от реальных противоречий и не превращать предположения LLM в факты.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Есть данные рынков, нужно ежемесячно делать отчеты и презентации по данным.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Test use case for senior data engineer online (time limited 60 min).
Краснодар Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Требуется создать систему автоматического формирования субтитров на основе аудио и видео материалов с использованием технологий искусственного интеллекта. Ориентиры - существующие сервисы speech2text.ru и any2text.ru, но задача - сделать продукт не хуже, а по ряду параметров лучше (расширенный функционал, гибкость, безопасность). Система должна работать как в онлайн-режиме (веб-сервис), так и в офлайн-режиме (локальная программа или self-hosted решение) для работы с конфиденциальными данными. Рассматриваются как готовые решения с доработкой, так и разработка с нуля. Основные функции системы: Автоматическое распознавание речи (ASR): Поддержка русского и иностранных языков (минимум 5–10 популярных). Высокая точность, возможность дообучения под специфическую лексику (историческую, техническую, кинематографическую). Учет контекста через промпты (до 250 слов). Разделение дикторов (Speaker Diarization): Автоматическое определение смены говорящего, присвоение идентификаторов (Мужчина 1, Женщина 1, Группа и т.д.). Возможность ручного переименования спикеров. Распознавание текста на видеоизображении (OCR): Детекция и оцифровка надписей, титров, вывесок. Классификация: диалог, экранный текст, титры. Возможность включать/исключать распознанные надписи в итоговый файл. Машинный перевод (MT): Автоматический перевод субтитров на минимум 14 языков. Сохранение таймкодов и структурной привязки текста (alignment). Учет культурных и исторических особенностей. Встроенный веб-редактор: Двухпанельный режим (оригинал/перевод, черновик/правка). Видеоплеер с покадровой навигацией. Управление таймкодами, разделение/объединение сегментов. Проверка орфографии, поиск и замена. Поддержка версионности (история изменений, откат). Экспорт субтитров: Форматы: SRT, VTT, JSON, XML, DOC/DOCX, ODT, TXT, STL (EBU). Диалоговые листы в Word. Возможность встраивания субтитров в видеофайл. Дополнительно (желательно): Загрузка диалоговых листов (сканы, текст) для повышения точности ASR. Автоматическая проверка соблюдения стандартов субтитрирования (ГОСТ, EBU). Работа в изолированном контуре без доступа в интернет. Технические требования: Использование современных open-source моделей: Whisper (faster-whisper), pyannote.audio, Helsinki-NLP и др. Возможность развертывания на сервере заказчика (on-premise) или в облаке (РФ). Веб-интерфейс (React/Vue + Python/FastAPI/Node.js). Поддержка GPU для ускорения обработки. Передача исходного кода и прав на использование. Ожидаемый результат: Работающий прототип (MVP) с базовым функционалом ASR + экспорт SRT. Полноценная система с редактором, диаризацией, переводом и OCR. Документация (руководство пользователя и администратора). Рассматриваю как отдельных специалистов, так и команды/студии. Как откликнуться: В отклике укажите: Ваш опыт в разработке ASR/ML-систем. Примеры похожих проектов (если есть). Предлагаемый стек технологий. Оценку сроков и стоимости (хотя бы вилку). Готовы ли работать с передачей исходного кода.
Москва Фрилансеры