AI Engineer (Middle)
Описание от работодателя
Мы — продуктовая компания, развиваем cowork.ru — корпоративную AI-платформу: агентный ассистент с подключаемыми инструментами (MCP), отложенными задачами, базами знаний и каталогом навыков. Ищем инженера в AI-команду: мы делаем экспериментальные фичи для продукта, быстрые PoC для B2B-заказчиков на базе платформы, standalone-решения и R&D — от агентских бенчмарков до вопросов инференса на собственных GPU.
Обязанности:
Разрабатывать агентные системы: tool use / function calling, многошаговое планирование, human-in-the-loop
Проектировать и подключать MCP-серверы: превращать внешние системы и данные в инструменты агентов
Быстро собирать PoC и MVP под заказчиков на базе платформы (сжатые сроки, живые демо)
Делать экспериментальные фичи для продукта и отдельные standalone-решения
Итеративно улучшать компоненты агентной системы — системные промпты, скилы, инструменты — опираясь на метрики и разбор траекторий (в том числе прогоны на нашем открытом агентском бенчмарке)
Тестировать и внедрять модели разных модальностей: текст, vision/OCR, ASR
Работать с базами знаний: RAG-пайплайны, гибридный поиск, обработка документов
Контейнеризировать и деплоить решения, в том числе on-prem
Требования: Опыт работы 1–3 года, есть реальные LLM-проекты (агенты, ассистенты, RAG)
Python (asyncio, FastAPI), Git, Docker / docker-compose
Уверенная работа с LLM API: OpenAI-compatible интерфейсы, function calling, structured output, стриминг
Опыт работы с большими моделями разных семейств (Qwen, DeepSeek, GigaChat, GPT/Claude/Gemini)
Понимание архитектуры LLM на прикладном уровне: трансформеры, MoE, контекстное окно и его ограничения, узкие места инференса
Понимание MCP (Model Context Protocol): устройство протокола, опыт создания или подключения серверов
RAG как один из навыков: chunking, embeddings, гибридный поиск (BM25 + dense), reranking
PostgreSQL, Redis
Оценка качества: eval-пайплайны, метрики, разбор трейсов агентов
Способность объяснить принятые технические решения и их trade-offs
Будет плюсом:
Опыт разворачивания инференса на GPU: vLLM / SGLang, multi-GPU конфигурации, квантизация (FP8/INT8)
Агентные фреймворки и SDK: Strands Agents, OpenAI Agents SDK, LangGraph, CAMEL
Durable execution: Restate, Temporal
Observability и трейсинг: Langfuse, OpenTelemetry
Мультимодальные модели: VLM (Qwen-VL и др.), OCR-пайплайны, ASR (Whisper и аналоги)
Фронтенд-навыки: собрать демо на React/TypeScript и показать решение
Опыт с LiteLLM или другими model-роутерами
Условия: Достойная заработная плата + годовой бонус
Сильная команда
ДМС с первого месяца работы
Работа в аккредитованной IT компании
Льготная ипотека от Сбера
Локация: Москва, м. Цветной бульвар.