An interview with Toloka CEO Olga Megorskaya on human-AI co-agency: how human-in-the-loop work evolved from labeling to expert judgment, RLHF, and benchmarks
Guest Post: Yambda-5B and Open Recommender System Datasets Explained
Yambda-5B is Yandex's open recommender dataset: 4.79B user interactions, audio embeddings, and organic flags — a production-scale alternative to MovieLens.
Reward engineering defines how AI agents learn. Covers reward functions, dense vs sparse rewards, RLHF reward models, value functions, and reward hacking.