← к выдаче
данные

AI Engineer (Middle)

Москвасегодня

Описание от работодателя

Мы — продуктовая компания, развиваем cowork.ru — корпоративную AI-платформу: агентный ассистент с подключаемыми инструментами (MCP), отложенными задачами, базами знаний и каталогом навыков. Ищем инженера в AI-команду: мы делаем экспериментальные фичи для продукта, быстрые PoC для B2B-заказчиков на базе платформы, standalone-решения и R&D — от агентских бенчмарков до вопросов инференса на собственных GPU. Обязанности: Разрабатывать агентные системы: tool use / function calling, многошаговое планирование, human-in-the-loop Проектировать и подключать MCP-серверы: превращать внешние системы и данные в инструменты агентов Быстро собирать PoC и MVP под заказчиков на базе платформы (сжатые сроки, живые демо) Делать экспериментальные фичи для продукта и отдельные standalone-решения Итеративно улучшать компоненты агентной системы — системные промпты, скилы, инструменты — опираясь на метрики и разбор траекторий (в том числе прогоны на нашем открытом агентском бенчмарке) Тестировать и внедрять модели разных модальностей: текст, vision/OCR, ASR Работать с базами знаний: RAG-пайплайны, гибридный поиск, обработка документов Контейнеризировать и деплоить решения, в том числе on-prem Требования: Опыт работы 1–3 года, есть реальные LLM-проекты (агенты, ассистенты, RAG) Python (asyncio, FastAPI), Git, Docker / docker-compose Уверенная работа с LLM API: OpenAI-compatible интерфейсы, function calling, structured output, стриминг Опыт работы с большими моделями разных семейств (Qwen, DeepSeek, GigaChat, GPT/Claude/Gemini) Понимание архитектуры LLM на прикладном уровне: трансформеры, MoE, контекстное окно и его ограничения, узкие места инференса Понимание MCP (Model Context Protocol): устройство протокола, опыт создания или подключения серверов RAG как один из навыков: chunking, embeddings, гибридный поиск (BM25 + dense), reranking PostgreSQL, Redis Оценка качества: eval-пайплайны, метрики, разбор трейсов агентов Способность объяснить принятые технические решения и их trade-offs Будет плюсом: Опыт разворачивания инференса на GPU: vLLM / SGLang, multi-GPU конфигурации, квантизация (FP8/INT8) Агентные фреймворки и SDK: Strands Agents, OpenAI Agents SDK, LangGraph, CAMEL Durable execution: Restate, Temporal Observability и трейсинг: Langfuse, OpenTelemetry Мультимодальные модели: VLM (Qwen-VL и др.), OCR-пайплайны, ASR (Whisper и аналоги) Фронтенд-навыки: собрать демо на React/TypeScript и показать решение Опыт с LiteLLM или другими model-роутерами Условия: Достойная заработная плата + годовой бонус Сильная команда ДМС с первого месяца работы Работа в аккредитованной IT компании Льготная ипотека от Сбера Локация: Москва, м. Цветной бульвар.