Разработчик ML-инфраструктуры стажер

Уровень зарплаты: не указан
Москва
Нет опыта, Полный день, Полная занятость
Дата публикации: 22.07.2026 с сайта superjob.ru

Требования

Блок AI
Мы развиваем технологии искусственного интеллекта для ключевых продуктов VK, создаём систему рекомендаций и поиска контента на наших платформах.

О команде
Cloud Training Platform — небольшая команда, которая создаёт единую платформу для обучения ML-моделей в VK. Мы обслуживаем сотни ML-инженеров и сотни моделей. Разрабатываем end-to-end решение для всего ML-пайплайна: от подготовки датасетов и тюнинга гиперпараметров до деплоя в продакшен. Наш технологический стек включает Go для бэкенда, Python для обработки данных и работы с моделями, а также инфраструктуру на базе внутренних решений VK. Сейчас мы поддерживаем обучение CatBoost и нейронных сетей, а также запуск экспериментов. Платформа используется в ключевых продуктах VK: рекламе, рекомендациях и поиске. Наша миссия — сделать процесс разработки и внедрения ML-моделей максимально эффективным и надёжным, позволяя ML-инженерам фокусироваться на качестве моделей, а не на инфраструктурных вопросах.

Предстоящие задачи
* Реализация новых функциональных возможностей на базе внутренней training-платформы.
* Участие в развитии функциональных возможностей для запуска, управления и мониторинга распределённого обучения.
* Улучшение observability процессов: логов, метрик, статусов, диагностики ошибок.
* Взаимодействие с ML-инженерами и инфраструктурными командами при развитии сценариев обучения моделей.

Необходимо иметь
* Базовое владение Go.
* Понимание классических алгоритмов и структур данных.
* Понимание HTTP/gRPC-сервисов.
* Базовое владение SQL и PostgreSQL: таблицы, индексы, транзакции, простая оптимизация запросов.
* Готовность разбираться в инфраструктурных задачах и читать документацию.

Будет преимуществом
* Понимание того, как устроен ML.
* Опыт с Docker, Prometheus, Grafana, OpenTelemetry или аналогичными инструментами.
* Понимание принципов надёжности, масштабируемости и observability production-систем.
* Понимание базовых метрик сервисов: latency, throughput, error rate.
* Базовое понимание очередей, кеширования или rate limiting.
Условия
* Команда: ведущие эксперты индустрии, готовые делиться своим опытом.
* Проекты и задачи: мы реализуем более 200 технологических продуктов, которыми пользуется свыше 95% аудитории рунета.
* Оборудование: у нас есть специализированные гаджеты и дополнительные мониторы для комфортной работы.
* Профессиональное развитие: проводим митапы, конференции, семинары и тренинги для сотрудников.
* Здоровье и спорт: в офисе есть фреш-бар с овощами и фруктами, спортивный зал с тренажёрами.
* Командный досуг: вместе проходим мастер-классы и тимбилдинги на свежем воздухе, смотрим кино и, конечно, танцуем на VK Fest.
* Офис в пяти минутах от метро, крытый паркинг, велопарковка, а летом ― прокат велосипедов, лонгбордов и самокатов.