По договорённости
Наша команда улучшает способности к рассуждениям Alice AI LLM. Вы будете масштабировать RLVR/RLHF-обучение reasoning-моделей, объединять сигналы из разных доменов в рамках единой модели и экспериментировать с различными функциями наград для улучшения повседневных B2C-сценариев пользователей. Команда: Yandex R&D.