Teaching LLMs to Generate Challenging MILP Instances via Solver Feedback
A challenger-solver asymmetric self-play approach, where an LLM challenger generates progressively harder instances and the solver verifies feasibility and hardness, so no seed or training MILP instances are required.