Вход Блог
Строительство и ремонт
Репетиторы
Красота
Фрилансеры
Разные специалисты
Уход за животными
Тренеры
Автоинструкторы

Программисты — удалённая работа в Москве

Дата: 2026-02-03
Детали
Регион
Москва
Занятость
дистанционно
Стоимость
договорная
Дата публикации
2026-02-03
Описание
Data Science. Настройка. ТЗ: Создание персональной RAG-системы для анализа большого архива текстов Кратко о проекте: Нужно создать персональную систему на основе RAG (Retrieval-Augmented Generation) для работы с моим архивом исследовательских текстов. Система должна позволять задавать вопросы на естественном языке и получать точные ответы, основанные исключительно на содержимом моих документов, без необходимости их ручной загрузки для каждого запроса. 1. Детальное описание проблемы (бэкграунд) У меня есть собрание авторских текстов (статьи) общим объёмом от 10 000 до 100 000+ слов. В настоящее время я пытаюсь работать с ними через чат DeepSeek, что приводит к следующим проблемам: • Невозможность работы со всем архивом: Лимит контекста чата не позволяет загружать все тексты одновременно. • Ненадёжность ссылок: Публикация текстов в откытых ресурсах и попытка загрузки по ссылкам приводит к искажениям и неполной передаче текста. • Непрактичность ручной загрузки: Копировать большие тексты вручную для каждого нового диалога — нереалистично. Цель: Преодолеть эти ограничения, перенести работу в специализированную систему, где весь архив будет проиндексирован и доступен для интеллектуального поиска. 2. Что нужно сделать (Конкретные задачи) Исполнителю необходимо разработать и развернуть рабочее решение, которое включает: 1. Загрузку и индексацию архива: o Приём предоставленных текстовых файлов (форматы: .txt, .pdf, .docx). o Настройку процесса разбивки текстов на оптимальные фрагменты (chunking) с учётом смысловой целостности. o Преобразование текстов в векторные эмбеддинги и сохранение в векторную базу данных. 2. Разработку ядра RAG-системы: o Создание модуля, который по текстовому запросу пользователя находит в векторной БД наиболее релевантные фрагменты из всего архива. o Интеграцию языковой модели (DeepSeek через официальный API) для генерации ответов на основе найденных фрагментов. o Настройка промта (инструкции) для LLM, чтобы ответы были точными, ссылались на исходные тексты и избегали «галлюцинаций». Т.З. писал ИИ. Могу в чем то ошибаться, но суть вопроса, надеюсь раскрыл.
Похожие заказы

Data scientist

дистанционно
договорная
Исследовательский анализ физиологических данных и временных рядов. Ищу специалиста для исследовательской работы с данными. Во время медитативных сессий смартфон регистрирует акселерометр и гироскоп, на их основе также рассчитываются дыхание и пульс. Задача — исследовать данные, искать артефакты и закономерности, различия между пользователями и сессиями, формулировать вопросы к участникам. Также формулирование гипотез и способов их проверки. Требуемый опыт: * использование ChatGPT / Claude или аналогов для исследовательского анализа данных * хорошее понимание математических методов анализа и обработки временных рядов и сигналов Формат: проектная работа с почасовой оплатой.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля, тестирование, настройка, доработка существующего продукта.
Екатеринбург Фрилансеры

Data scientist

дистанционно
договорная
Помочь разобраться в материале.
Москва Фрилансеры

Разработка на Python

дистанционно
договорная
Data Science. Разработка с нуля. Есть архив телефонных разговоров из МегаФон ВАТС — ориентировочно 400–500 MP3-файлов на русском языке. Средняя длительность разговора около 1–2 минут. Мне нужно не транскрибировать файлы вручную, а сделать простую автоматизацию, которая пакетно обработает всю папку. Что я предоставлю: папку с выбранными MP3; историю звонков в Excel; при необходимости — отдельный временный API-ключ для сервиса транскрибации; пример одного реального MP3. Что нужно сделать: Написать простой скрипт для пакетной обработки всех MP3 в папке. Транскрибировать русскую речь через Whisper / faster-whisper либо согласованный API. Обязательно сохранять связь транскрипта с исходным именем MP3. При повторном запуске не обрабатывать уже готовые файлы заново. Ошибочные/необработанные файлы складывать в отдельный список. По возможности извлекать из имени файла дату, время, направление звонка и номера телефонов. Если это не усложняет решение — сопоставить транскрипты с предоставленной Excel-историей звонков. Что должно быть на выходе: один CSV или XLSX со столбцами примерно: filename date time direction phone_from phone_to duration transcript status отдельный .txt для каждого разговора; папка с результатами; файл со списком ошибок; исходный скрипт; короткая инструкция: как запустить обработку новой папки самостоятельно. Важно: решение должно быть простым, без сложной инфраструктуры; Telegram-боты для транскрибации не использовать; аудиозаписи и транскрипты никуда не сохранять после выполнения работы; API-ключи не прописывать в коде; если используете локальный faster-whisper — отлично; если используется платный API — предварительно согласовать со мной. Первый этап — проверить всё на 5–10 MP3. После подтверждения качества запускаем весь массив. В отклике напишите: каким способом предлагаете делать; нужен ли вам GPU; сколько времени займёт настройка; стоимость; пример похожей задачи, если ест.
Москва Фрилансеры

Программисты

дистанционно
договорная
Data Science. Разработка с нуля. Пожелания и особенности: Ищу No-code разработчика / IT-специалиста для создания ИИ-агента, который автоматизирует разбор коммерческих предложений (ТКП) от поставщиков.Логика работы системы:Входящий триггер: Мониторинг почты Gmail на предмет новых писем с ТКП и счетами (приходят в хаотичном формате: текст письма, Excel, PDF-сканы).ИИ-Парсинг: Письмо и вложения отправляются по API в нейросеть (GPT-4o / Claude). Нейросеть должна распознать текст/таблицу, извлечь название компании-поставщика и вытащить табличную часть: Наименование товара, Количество, Цена за единицу с НДС. Пустые письма-отбивки без цен — игнорировать.Выгрузка: Автоматическая запись извлеченных данных в итоговую сравнительную Google Таблицу, сопоставляя позиции поставщика с позициями нашего исходного ТЗ.Стек: На ваше усмотрение (Python, Make.com, n8n, Albato). Подключение к почте строго через App Passwords.Жду откликов с примерной стоимостью и сроками. Готов предоставить примеры писем для теста.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Доработка существующего продукта. Пожелания и особенности: Будет дана google таблица, в которой отмечены товары, нужно будет в приложении отмечать этот товар.
Москва Фрилансеры

Data scientist

дистанционно
договорная
Провести анализ для открытия точки по аренде инструмента.
Москва Фрилансеры