← к выдаче
разработка

Python-разработчик AI-сервисов (LLM / RAG)

QSOFTМосква5 дн. назад

Коротко

Develops HTTP API and business logic of two async Python services on FastAPI; designs and implements RAG pipelines; develops agent scenarios on LangChain

Описание от работодателя

TEAMLY – это IT-платформа для совместной работы и управления знаниями. Она бесшовно объединяет функции командной работы, ведения базы знаний и корпоративного обучения. Благодаря разнообразному функционалу она позволяет переводить весь накопленный опыт компании в реально работающие навыки и знания сотрудников. Нам доверяют свои знания известные компании: ВкусВилл, Аналитический центр при Правительстве РФ, Капитал Life, 1С-Рарус, Интерлизинг. А также средний и малый бизнес , например, Грузчики.ру. В данный момент команда TEAMLY активно растет, в связи с чем мы будем рады видеть в нашей команде QA Engineer / Тестировщика . Востребованный продукт гарантирует быстрый рост и интересные задачи. Чем предстоит заниматься Развивать HTTP API и бизнес-логику двух асинхронных Python-сервисов на FastAPI. Проектировать и реализовывать RAG-пайплайны: retrieval, query rewriting, multi-hop поиск, сбор контекста, structured output, цитирование источников и обработку частичных ответов. Развивать агентные сценарии на LangChain, LangGraph и deepagents: инструменты, middleware, ограничения числа вызовов, защита от циклов и контроль контрактов ответа. Улучшать качество семантического поиска: chunking, dense/sparse retrieval, фильтры Qdrant, reranking, RRF и token budget. Развивать событийную индексацию статей, файлов и структурированного контента через Kafka. Обеспечивать корректную мультитенантность и фильтрацию результатов по правам пользователей, групп и сообществ. Интегрировать и заменять LLM-, embedding- и reranking-провайдеры, включая OpenAI-compatible API, vLLM и Ollama. Работать с PostgreSQL, Redis и Qdrant, проектировать модели данных и Alembic-миграции. Диагностировать проблемы качества, производительности и надежности на границах внешних сервисов. Развивать автоматические тесты и quality gates, поддерживать воспроизводимые локальные и CI-окружения. Улучшать наблюдаемость: структурированные логи, технические метрики, OpenTelemetry и трассировку LLM/RAG через Langfuse. Участвовать в декомпозиции задач, ревью кода и принятии архитектурных решений. Технологический стек Python 3.12, async/await; FastAPI, Pydantic 2; SQLAlchemy 2 async, Alembic, PostgreSQL; Redis, Apache Kafka, aiokafka; Qdrant, dense/sparse vectors, embeddings, reranking, RRF; LangChain, LangGraph, deepagents; OpenAI-compatible API, vLLM, Ollama; Pytest, pytest-asyncio, mypy, Black, Flake8; Docker, Docker Compose, Kubernetes, GitLab CI; Langfuse, OpenTelemetry. Что для нас важно Уверенное владение Python и практический опыт разработки backend-сервисов. Хорошее понимание асинхронного программирования: event loop, конкурентный I/O, таймауты, отмена, управление ресурсами и graceful shutdown. Опыт разработки API на FastAPI или сопоставимом Python-фреймворке. Практический опыт с PostgreSQL и SQLAlchemy: транзакции, конкурентный доступ, индексы, миграции и диагностика запросов. Опыт интеграции внешних сервисов и проектирования устойчивого взаимодействия: retry/backoff, timeout, idempotency, ограничение параллелизма и обработка частичных отказов. Понимание событийной архитектуры и семантики Kafka consumer: consumer groups, offset commit, rebalance, повторная доставка и идемпотентная обработка. Понимание устройства RAG: chunking, embeddings, retrieval, reranking, контекстное окно, ограничения LLM и способы снижения галлюцинаций. Умение писать unit- и интеграционные тесты для асинхронного кода, отделяя бизнес-логику от внешней инфраструктуры. Способность разбираться в существующей кодовой базе, находить причины проблем и предлагать минимальные, проверяемые изменения.​​​​​​​​​​​​​​​​​​​​ Будет преимуществом Production-опыт с Qdrant или другой векторной базой. Практический опыт hybrid search, sparse retrieval, reranker и оценки ранжирования по Precision@K, Recall@K, MRR, MAP или NDCG. Опыт разработки LLM-приложений на LangChain/LangGraph или другом orchestration framework. Опыт работы со structured output, function/tool calling и потоковой генерацией. Понимание prompt injection, разграничения доступа к данным и других рисков безопасности RAG/agent-систем. Опыт эксплуатации сервисов в Kubernetes и настройки observability. Опыт работы с локальными моделями и inference-серверами: vLLM, Ollama, embedding/reranking inference.