LLM & SLM 研究日报
算法·训练·推理 —— 大语言模型与小语言模型的前沿研究
生成时间: 2026/7/22 09:01:05
📊 今日概况
| 方向 | 论文数 |
|---|---|
| 🧮 算法与架构 | 10 |
| 🏋️ 训练方法 | 7 |
| ⚡ 推理优化 | 7 |
| 总计扫描 | 50 |
📝 论文列表
🧮 算法与架构 (10 篇)
1. SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
- arXiv: 2607.18213
- 摘要: swe,pruner,pro,prune,context,agent,oolong,coder,knows,pruning
- 关键词: swe,pruner,pro,prune,context,agent,oolong,coder,knows,pruning
2. PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning
- arXiv: 2607.18199
- 摘要: ppl,aware,factory,selection,perplexity,budget,gsm8k,data,task,reasoning
- 关键词: ppl,aware,factory,selection,perplexity,budget,gsm8k,data,task,reasoning
3. When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs
- arXiv: 2607.17828
- 摘要: bangla,culturally,name,cultural,homographs,entangled,bias,reading,pretraining,labelled
- 关键词: bangla,culturally,name,cultural,homographs,entangled,bias,reading,pretraining,labelled
4. ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions
- arXiv: 2607.17812
- 摘要: escucha,spanish,lalms,speech,audio,questions,acoustic,reasoning,benchmark,heterogeneous
- 关键词: escucha,spanish,lalms,speech,audio,questions,acoustic,reasoning,benchmark,heterogeneous
5. C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference
- arXiv: 2607.17715
- 摘要: reuse,cache,composable,inference,llm,compression,prefix,concatenation,compressed,long
- 关键词: reuse,cache,composable,inference,llm,compression,prefix,concatenation,compressed,long
6. How Reliable Are Multimodal Signals of Conversational State? Evidence from Remote Dyadic Collaborative Tasks
- arXiv: 2607.17452
- 摘要: conversational,task,speaker,reliable,multimodal,features,dyadic,cognitive,load,reliability
- 关键词: conversational,task,speaker,reliable,multimodal,features,dyadic,cognitive,load,reliability
7. The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation
- arXiv: 2607.17420
- 摘要: persona,librarian,personas,code,completions,engineer,opus,refused,correctness,responses
- 关键词: persona,librarian,personas,code,completions,engineer,opus,refused,correctness,responses
8. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- arXiv: 2607.18171
- 摘要: flashrt,agent,deployments,latency,multimodal,harness,mi355x,throughput,amd,omni
- 关键词: flashrt,agent,deployments,latency,multimodal,harness,mi355x,throughput,amd,omni
9. Adaptive Mamba Neural Operators
- arXiv: 2607.18043
- 摘要: amo,mamba,meshes,pdes,ssms,adaptive,geometries,takenaka,afd,neural
- 关键词: amo,mamba,meshes,pdes,ssms,adaptive,geometries,takenaka,afd,neural
10. MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- arXiv: 2607.18006
- 摘要: mada,critic,generator,critics,debate,reasoning,advantage,deepscaler,compact,counterfactual
- 关键词: mada,critic,generator,critics,debate,reasoning,advantage,deepscaler,compact,counterfactual
🏋️ 训练方法 (7 篇)
1. How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs?
- arXiv: 2607.18114
- 摘要: cue,bias,biases,sycophancy,induced,alignment,tuning,llms,intervention,susceptibility
- 关键词: cue,bias,biases,sycophancy,induced,alignment,tuning,llms,intervention,susceptibility
2. What Transfers Under Source Shift? Definitions, Examples, and Fine-Tuning for Climate Disclosure Classification
- arXiv: 2607.17952
- 摘要: source,disclosure,climate,strategies,definitions,disclosures,shift,tuning,adaptation,examples
- 关键词: source,disclosure,climate,strategies,definitions,disclosures,shift,tuning,adaptation,examples
3. DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration
- arXiv: 2607.17935
- 摘要: deliver,reinforced,veracity,decomposed,grounded,grpo,planner,exploration,politifact,qwen2
- 关键词: deliver,reinforced,veracity,decomposed,grounded,grpo,planner,exploration,politifact,qwen2
4. When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs
- arXiv: 2607.17828
- 摘要: bangla,culturally,name,cultural,homographs,entangled,bias,reading,pretraining,labelled
- 关键词: bangla,culturally,name,cultural,homographs,entangled,bias,reading,pretraining,labelled
5. OR Else: A Differentiable Trust Region for Policy Optimization
- arXiv: 2607.18163
- 摘要: grpo,ppo,gae,reward,clipped,rollout,relative,texttt,score,clip
- 关键词: grpo,ppo,gae,reward,clipped,rollout,relative,texttt,score,clip
6. Manifold-Constrained Hyper-Connections for Parameter-Efficient Finetuning
- arXiv: 2607.18130
- 摘要: mhc,peft,residual,finetuning,connections,lora,hyper,frozen,olmo,manifold
- 关键词: mhc,peft,residual,finetuning,connections,lora,hyper,frozen,olmo,manifold
7. Information-Based Exploration via Random Features for Reinforcement Learning
- arXiv: 2607.17981
- 摘要: rfig,exploration,gain,random,information,reinforcement,deep,bonuses,optimism,algorithms
- 关键词: rfig,exploration,gain,random,information,reinforcement,deep,bonuses,optimism,algorithms
⚡ 推理优化 (7 篇)
1. VDAR-Router: Adaptive LLMs Routing via Verbalized Query Difficulty Analysis Retrieval
- arXiv: 2607.18098
- 摘要: vdar,routing,router,difficulty,query,retrieval,verbalized,cost,suitability,llm
- 关键词: vdar,routing,router,difficulty,query,retrieval,verbalized,cost,suitability,llm
2. C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference
- arXiv: 2607.17715
- 摘要: reuse,cache,composable,inference,llm,compression,prefix,concatenation,compressed,long
- 关键词: reuse,cache,composable,inference,llm,compression,prefix,concatenation,compressed,long
3. FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- arXiv: 2607.18171
- 摘要: flashrt,agent,deployments,latency,multimodal,harness,mi355x,throughput,amd,omni
- 关键词: flashrt,agent,deployments,latency,multimodal,harness,mi355x,throughput,amd,omni
4. Differentiable Logic Gate Networks for Low-Latency EEG Classification on Edge Devices
- arXiv: 2607.18149
- 摘要: logic,diff,eeg,latency,mlp,dementia,times,differentiable,gate,difflogic
- 关键词: logic,diff,eeg,latency,mlp,dementia,times,differentiable,gate,difflogic
5. Empowering On-Device Model Adaptation with an Edge AI Inference Accelerator
- arXiv: 2607.18101
- 摘要: accelerator,device,adaptation,edge,inference,cpu,empowering,backbone,training,repurposes
- 关键词: accelerator,device,adaptation,edge,inference,cpu,empowering,backbone,training,repurposes
6. SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
- arXiv: 2607.18081
- 摘要: selectinfer,loading,selective,neuron,computation,llm,neurons,footprint,llms,memory
- 关键词: selectinfer,loading,selective,neuron,computation,llm,neurons,footprint,llms,memory
7. FlashPDE: A Drop-in Fused Triton Operator Library for Neural PDE Solvers
- arXiv: 2607.18020
- 摘要: flashpde,pde,pytorch,fused,triton,library,execution,differentiable,drop,solvers
- 关键词: flashpde,pde,pytorch,fused,triton,library,execution,differentiable,drop,solvers
今日技术热点
今日扫描到 算法与架构 10 篇、训练方法 7 篇、推理优化 7 篇。
算法与架构趋势
当前 LLM 架构正从纯 Transformer 向混合架构演进:SSM (Mamba) 和线性注意力在长序列场景展现优势,MoE 在推理成本可控的前提下持续扩展参数规模。小模型架构注重蒸馏和紧凑设计。
训练方法趋势
DPO 和直接偏好优化正在成为 RLHF 的高效替代方案。合成数据质量成为新的研究焦点。LoRA/QLoRA 已成为高效微调的事实标准。
推理优化趋势
INT4 量化 (GPTQ/AWQ) 已成熟,GGUF 格式让端侧部署成为可能。Speculative decoding 在线推理中逐步普及。KV cache 压缩是降低长上下文推理成本的关键。
关键洞察
- 架构多元化: Transformer 不再是唯一选择,SSM 和混合架构值得持续关注
- 对齐轻量化: DPO 系列方法降低了高质量对齐的门槛
- 推理即服务: 推理优化的研究热度反映了部署需求的爆发
- 小模型逆袭: 端侧 SLM 的设计思路与大模型差异显著,需要专门的技术栈
- 数据 > 算法: 训练数据质量对模型能力的影响被重新审视
学习建议
- 重点关注 Mamba/Mamba-2 和混合架构的最新论文
- 实践 DPO 训练流程,对比 RLHF 的效果差异
- 尝试 vLLM + 量化模型的端到端推理优化
注:GLM-5 API 未调用,此为备用分析
📚 附录
筛选关键词
算法: attention mechanism, mixture of experts, MoE, sparse attention, flash attention, rotary position, RoPE, grouped query, GQA, KV cache …
训练: pre-training, pretraining, post-training, fine-tuning, finetuning, supervised fine-tuning, SFT, alignment, RLHF, DPO …
推理: inference, serving, latency, throughput, speculative decoding, batching, continuous batching, PagedAttention, vLLM, quantization …
本报告由 OpenClaw 自动生成 | LLM & SLM Research Daily