Teaching LLMs to Generate Challenging MILP Instances via Solver Feedback
A challenger-solver asymmetric self-play approach, where an LLM challenger generates progressively harder instances and the solver verifies feasibility and hardness, so no seed or training MILP instances are required.
Jitin Singla, Parikshit Pareek, P. Jawanpuria et al.
· 0 citations