Michal Valko
This public profile has been imported and is waiting for source-backed enrichment.
Skills
reinforcement learning, large language models, deep reinforcement learning, bandit algorithms, self-supervised learning, self play, scalable fine-tuning, alignment, algorithm design