Tag: Supervised Learning
All the articles with the tag "Supervised Learning".
-
MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability
本文提出 MASKSEARCH 框架,通过 Retrieval-Augmented Mask Prediction (RAMP) 预训练任务结合监督微调和强化学习,显著提升了大型语言模型在开放域多跳问答任务中的代理搜索能力。
-
Temporal Sampling for Forgotten Reasoning in LLMs
本文揭示了大型语言模型微调中的'Temporal Forgetting'现象,并提出'Temporal Sampling'方法,通过从多个训练检查点采样答案显著提升推理性能(Pass@k提升4-19个百分点),并通过LoRA适配降低存储成本。
-
Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
本文挑战了推理 LLMs 中更长思考链提升性能的假设,提出 *short-m@k* 推理方法,通过优先选择较短推理链实现高达 34.5% 的准确率提升和 40% 的计算量减少,并通过微调验证了短推理链训练的有效性。
-
Incentivizing Strong Reasoning from Weak Supervision
本文提出弱到强推理(W2SR)范式,通过显著较弱教师模型生成的结构化链式思维轨迹对强学生模型进行监督微调,以低成本方式显著提升其推理能力,接近甚至超越昂贵的强化学习效果。
-
R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search
R1-Compress通过块级压缩和块间搜索机制有效压缩长链式推理(Long-CoT),在减少约20% token使用量的同时保持了与基线接近的推理准确率(92.4% vs 93.0%)。