Python-разработчик AI-сервисов (LLM / RAG)
Коротко
Develops HTTP API and business logic of two async Python services on FastAPI; designs and implements RAG pipelines; develops agent scenarios on LangChain
Описание от работодателя
TEAMLY – это IT-платформа для совместной работы и управления знаниями. Она бесшовно объединяет функции командной работы, ведения базы знаний и корпоративного обучения.
Благодаря разнообразному функционалу она позволяет переводить весь накопленный опыт компании в реально работающие навыки и знания сотрудников.
Нам доверяют свои знания известные компании: ВкусВилл, Аналитический центр при Правительстве РФ, Капитал Life, 1С-Рарус, Интерлизинг. А также средний и малый бизнес , например, Грузчики.ру.
В данный момент команда TEAMLY активно растет, в связи с чем мы будем рады видеть в нашей команде QA Engineer / Тестировщика . Востребованный продукт гарантирует быстрый рост и интересные задачи.
Чем предстоит заниматься Развивать HTTP API и бизнес-логику двух асинхронных Python-сервисов на FastAPI.
Проектировать и реализовывать RAG-пайплайны: retrieval, query rewriting, multi-hop поиск, сбор контекста, structured output, цитирование источников и обработку частичных ответов.
Развивать агентные сценарии на LangChain, LangGraph и deepagents: инструменты, middleware, ограничения числа вызовов, защита от циклов и контроль контрактов ответа.
Улучшать качество семантического поиска: chunking, dense/sparse retrieval, фильтры Qdrant, reranking, RRF и token budget.
Развивать событийную индексацию статей, файлов и структурированного контента через Kafka.
Обеспечивать корректную мультитенантность и фильтрацию результатов по правам пользователей, групп и сообществ.
Интегрировать и заменять LLM-, embedding- и reranking-провайдеры, включая OpenAI-compatible API, vLLM и Ollama.
Работать с PostgreSQL, Redis и Qdrant, проектировать модели данных и Alembic-миграции.
Диагностировать проблемы качества, производительности и надежности на границах внешних сервисов.
Развивать автоматические тесты и quality gates, поддерживать воспроизводимые локальные и CI-окружения.
Улучшать наблюдаемость: структурированные логи, технические метрики, OpenTelemetry и трассировку LLM/RAG через Langfuse.
Участвовать в декомпозиции задач, ревью кода и принятии архитектурных решений.
Технологический стек Python 3.12, async/await;
FastAPI, Pydantic 2;
SQLAlchemy 2 async, Alembic, PostgreSQL;
Redis, Apache Kafka, aiokafka;
Qdrant, dense/sparse vectors, embeddings, reranking, RRF;
LangChain, LangGraph, deepagents;
OpenAI-compatible API, vLLM, Ollama;
Pytest, pytest-asyncio, mypy, Black, Flake8;
Docker, Docker Compose, Kubernetes, GitLab CI;
Langfuse, OpenTelemetry.
Что для нас важно Уверенное владение Python и практический опыт разработки backend-сервисов.
Хорошее понимание асинхронного программирования: event loop, конкурентный I/O, таймауты, отмена, управление ресурсами и graceful shutdown.
Опыт разработки API на FastAPI или сопоставимом Python-фреймворке.
Практический опыт с PostgreSQL и SQLAlchemy: транзакции, конкурентный доступ, индексы, миграции и диагностика запросов.
Опыт интеграции внешних сервисов и проектирования устойчивого взаимодействия: retry/backoff, timeout, idempotency, ограничение параллелизма и обработка частичных отказов.
Понимание событийной архитектуры и семантики Kafka consumer: consumer groups, offset commit, rebalance, повторная доставка и идемпотентная обработка.
Понимание устройства RAG: chunking, embeddings, retrieval, reranking, контекстное окно, ограничения LLM и способы снижения галлюцинаций.
Умение писать unit- и интеграционные тесты для асинхронного кода, отделяя бизнес-логику от внешней инфраструктуры.
Способность разбираться в существующей кодовой базе, находить причины проблем и предлагать минимальные, проверяемые изменения.
Будет преимуществом
Production-опыт с Qdrant или другой векторной базой.
Практический опыт hybrid search, sparse retrieval, reranker и оценки ранжирования по Precision@K, Recall@K, MRR, MAP или NDCG.
Опыт разработки LLM-приложений на LangChain/LangGraph или другом orchestration framework.
Опыт работы со structured output, function/tool calling и потоковой генерацией.
Понимание prompt injection, разграничения доступа к данным и других рисков безопасности RAG/agent-систем.
Опыт эксплуатации сервисов в Kubernetes и настройки observability.
Опыт работы с локальными моделями и inference-серверами: vLLM, Ollama, embedding/reranking inference.