CHQR: A Context-Aware Hybrid Query Routing Framework for Energy-and Latency-Optimized Academic Question Answering
The rapid adoption of Large Language Models (LLMs) for academic question answering has led to significant computational overhead, increased latency, and high energy consumption, even for queries that require minimal reasoning. Existing systems typically route all queries to LLMs without considering their complexity or...