LLM & SLM 研究日报
算法·训练·推理 —— 大语言模型与小语言模型的前沿研究
生成时间: 2026/7/24 09:30:14
📊 今日概况
| 方向 | 论文数 |
|---|---|
| 🧮 算法与架构 | 5 |
| 🏋️ 训练方法 | 6 |
| ⚡ 推理优化 | 5 |
| 总计扫描 | 50 |
📝 论文列表
🧮 算法与架构 (5 篇)
1. PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
- arXiv: 2607.20327
- 摘要: llm,pyrodash,token,slm,cost,percent,reasoning,inference,usd,accuracy
- 关键词: llm,pyrodash,token,slm,cost,percent,reasoning,inference,usd,accuracy
2. Language-Specific versus Cross-Lingual Knowledge Graphs for Implicit Aspect Identification in Arabic: A Comparative Study of Reasoning and Adaptation Strategies
- arXiv: 2607.20056
- 摘要: arabic,absa,haad,semeval,aspect,language,2016,lingual,implicit,adaptation
- 关键词: arabic,absa,haad,semeval,aspect,language,2016,lingual,implicit,adaptation
3. When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization
- arXiv: 2607.19956
- 摘要: distillation,cpdp,rouge,ewad,chad,bansum,0003,aware,harm,reliability
- 关键词: distillation,cpdp,rouge,ewad,chad,bansum,0003,aware,harm,reliability
4. User-Centric Modeling of Transactional Sequences with Explainable State Space Models
- arXiv: 2607.20228
- 摘要: coles,mamba,transactional,user,ssm,centric,sequences,contrastive,gradients,selective
- 关键词: coles,mamba,transactional,user,ssm,centric,sequences,contrastive,gradients,selective
5. ELSAA: Efficient Low-Rank and Sparse Attention Approximation for Training Transformers
- arXiv: 2607.20214
- 摘要: elsaa,rank,sparse,attention,branch,low,interactions,denominator,transformers,score
- 关键词: elsaa,rank,sparse,attention,branch,low,interactions,denominator,transformers,score
🏋️ 训练方法 (6 篇)
1. LKValues: Aligning Large Language Models with Sri Lankan Societal Values
- arXiv: 2607.20410
- 摘要: lkvalues,sri,lankan,sinhala,values,value,alignment,lkvaluesbench,base,qwen3
- 关键词: lkvalues,sri,lankan,sinhala,values,value,alignment,lkvaluesbench,base,qwen3
2. The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models
- arXiv: 2607.20265
- 摘要: maskability,prompting,pretrained,knowledge,language,masked,templates,atomic2020,index,objective
- 关键词: maskability,prompting,pretrained,knowledge,language,masked,templates,atomic2020,index,objective
3. SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
- arXiv: 2607.20145
- 摘要: deepseek,ascend,superpod,sft,slai,rex,flash,training,trillion,post
- 关键词: deepseek,ascend,superpod,sft,slai,rex,flash,training,trillion,post
4. Online Variance Reduction for Domain Adaptation on Streaming Data
- arXiv: 2607.20374
- 摘要: svr,online,variance,coral,reduction,mmd,reweighting,arrow,offline,reweights
- 关键词: svr,online,variance,coral,reduction,mmd,reweighting,arrow,offline,reweights
5. Variance-reduced Domain Adaptation using Paired Sampling
- arXiv: 2607.20367
- 摘要: psda,variance,domain,svr,adaptation,paired,losses,quadruplets,reduced,sampling
- 关键词: psda,variance,domain,svr,adaptation,paired,losses,quadruplets,reduced,sampling
6. The Blessing of Dimensionality: How Near-Orthogonality in High-Dimensional Spaces Explains Temporal Portability
- arXiv: 2607.20301
- 摘要: portllm,portability,continual,pretraining,temporal,orthogonality,lora,blessing,tuning,fine
- 关键词: portllm,portability,continual,pretraining,temporal,orthogonality,lora,blessing,tuning,fine
⚡ 推理优化 (5 篇)
1. PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
- arXiv: 2607.20327
- 摘要: llm,pyrodash,token,slm,cost,percent,reasoning,inference,usd,accuracy
- 关键词: llm,pyrodash,token,slm,cost,percent,reasoning,inference,usd,accuracy
2. TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models
- arXiv: 2607.19992
- 摘要: schiller,tiny,german,literary,parser,drop,drama,dracor,gerdracor,cl100k
- 关键词: schiller,tiny,german,literary,parser,drop,drama,dracor,gerdracor,cl100k
3. Variance-reduced Domain Adaptation using Paired Sampling
- arXiv: 2607.20367
- 摘要: psda,variance,domain,svr,adaptation,paired,losses,quadruplets,reduced,sampling
- 关键词: psda,variance,domain,svr,adaptation,paired,losses,quadruplets,reduced,sampling
4. Active Inference as a Convex Markov Decision Process
- arXiv: 2607.20152
- 摘要: efe,policy,epistemic,reward,active,inference,aif,performative,minimization,pragmatic
- 关键词: efe,policy,epistemic,reward,active,inference,aif,performative,minimization,pragmatic
5. Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference
- arXiv: 2607.20124
- 摘要: tsetlin,consensus,decentralized,collaborative,machines,paradigm,agents,among,inference,ensemble
- 关键词: tsetlin,consensus,decentralized,collaborative,machines,paradigm,agents,among,inference,ensemble
LLM/SLM 深度技术洞察报告
1. 今日技术热点
今日的论文呈现出算法架构轻量化、训练方法动态化、推理部署协同化的核心趋势。
在算法与架构方面,稀疏注意力与状态空间模型(SSM)成为突破Transformer算力瓶颈的关键。ELSAA通过低秩与稀疏近似大幅降低训练开销,而基于Mamba的SSM在事务序列建模中展现出解释性与效率的双重优势。训练方法上,研究焦点从静态对齐转向动态适应与可解释微调,“掩蔽能力指数”为预训练模型的任务对齐提供了量化预测工具,而“维度诅咒”理论则从高维近正交性角度为LLM的时序持续学习提供了新解释。推理优化领域,SLM与LLM的协同推理成为最亮眼的新思路,PyroDash在Token级别实现大小模型协作,在保持准确率的同时显著削减推理成本。
2. 算法与架构趋势
Attention机制演进:标准密集注意力的计算开销正促使架构分化。ELSAA提出的“低秩+稀疏”注意力近似,通过分离交互分支优化分母项,为Transformer训练提供了高效替代方案。同时,以Mamba为代表的SSM架构正渗透至垂直域,基于选择性状态空间的建模在事务序列中不仅兼顾长上下文,还提供了用户级的可解释性。
MoE与路由设计:虽然今日无直接MoE论文,但Tsetlin Machines的自治协同集成范式提供了去中心化路由的新视角,通过共识机制实现多智能体协同推理,为传统集中式MoE路由提供了分布式替代思路。
长上下文处理:技术路线正从“扩展上下文窗口”转向“状态空间记忆”与“Token级动态路由”。SSM通过隐藏状态压缩历史信息,而PyroDash则通过Token级判断,将简单Token交由SLM处理,复杂Token交由LLM,实现长文本处理的降本增效。
小模型架构创新:SLM架构正向领域极度特化发展。TINY_SCHILLER针对德语戏剧语料定制词表与结构,证明在极小参数量下通过领域强先验也能达到优异解析性能。
3. 训练方法趋势
对齐技术新范式:RLHF之外的替代方案持续涌现。LKValues通过对Qwen3等基座模型进行特定社会价值观(斯里兰卡语境)的全参数对齐,展示了文化本地化对齐的工程实践;同时,基于主动推理的凸马尔可夫决策过程,将认知论与实用论奖励结合,为模型策略对齐提供了理论框架。
数据工程与可解释微调:“掩蔽能力指数”通过分析预训练模型的掩蔽模板,量化模型知识与任务目标的原子级对齐程度,为数据课程学习提供了筛选依据。在低资源语言摘要任务中,知识蒸馏的负面效应被揭示,推动了可靠性感知的蒸馏方案。
高效微调与持续学习:“维度诅咒”理论指出,高维空间的近正交性赋予了LLM时序可移植性。这意味着基于正交子空间的LoRA等微调技术,在应对时间漂移数据时具有天然的稳定性,为持续预训练提供了理论支撑。
训练稳定性与规模化:SLAI T-Rex展示了在Ascend SuperPOD上对万亿参数DeepSeek-V4家族进行全参数后训练的实践,揭示了国产算力集群在超大规模SFT中的系统级优化技巧。
4. 推理优化趋势
量化与协同推理:当前推理优化的重心从单纯的INT8/INT4量化,转向大小模型协同。PyroDash在Token级动态路由SLM与LLM,将大部分简单推理交给SLM,仅将高难度推理Token交由LLM,实现了成本与精度的帕累托最优。
端侧部署与模型设计:端侧模型不再一味追求通用泛化,而是转向“语料级定制”。TINY_SCHILLER作为即插即用的德语戏剧语料库,针对特定分词器优化,大幅降低了小语言模型在特定NLP任务上的推理负担。
KV Cache与流式适应:在流式数据场景下,基于在线方差归约的域适应方法通过重新加权历史样本,隐式优化了特征分布的漂移,这与KV Cache中淘汰过期Token的策略异曲同工,提升了长序列流式推理的稳定性。
去中心化推理:Tsetlin Machines的协同学习范式展示了无需中心路由的集成推理机制,通过智能体间的共识机制进行推理,为边缘设备集群部署提供了低通信开销的分布式推理方案。
5. 关键洞察
- 大小模型协同是降本增效的下一站:PyroDash证明,在Token级别动态分配SLM与LLM的计算负载,能在维持推理准确率的同时大幅削减API成本。工程实践中,应设计基于置信度的路由网关,实现推理成本的动态控制。
- 知识蒸馏需警惕“可靠性反噬”:低资源语言摘要研究发现,盲目蒸馏会损害模型生成的可靠性。建议在蒸馏流程中引入可靠性感知机制(如EWAD),对输出分布进行约束,避免小模型“学废”。
- SSM在序列建模中具备可解释性优势:基于Mamba的事务序列建模不仅能高效处理长上下文,还能通过状态空间提供用户级解释。金融/行为建模领域应关注SSM替代Transformer的潜力。
- 高维正交性为持续学习提供理论庇护:“维度诅咒”论文揭示了LLM参数高维空间的近正交性使得旧知识干扰减小。工程上,利用正交LoRA适配器进行时序数据微调,可有效缓解灾难性遗忘。
- 掩蔽测试应作为微调前的探针:“掩蔽能力指数”提供了一种量化预训练模型任务对齐度的方法。在昂贵的SFT之前,建议先通过掩蔽模板测试模型原子知识,以降低试错成本。
- 超大规模后训练高度依赖软硬件协同:SLAI T-Rex在Ascend SuperPOD上的实践表明,万亿参数模型的后训练不仅需要算法调优,更依赖Flash Attention等算子与底层硬件架构的深度适配。
- 小模型部署应走向“词表与语料极简定制”:TINY_SCHILLER针对德语戏剧的定制化表明,SLM在特定领域部署时,通过裁剪通用词表、注入领域强先验语料,能显著提升推理效率并降低显存占用。
6. 开源生态动态
今日研究动态与当前开源生态紧密契合。PyroDash的大小模型协同机制可直接应用于基于vLLM的推理集群,通过自定义Router实现流量的分级调度。LKValues基于Qwen系列的开源实践,进一步丰富了HuggingFace生态中的多语言对齐数据集。SLAI T-Rex在Ascend SuperPOD上的训练实践,标志着除了NVIDIA CUDA生态外,基于PyTorch的国产Ascend算力开源适配正在走向万亿参数规模成熟。此外,针对特定语料的TINY_SCHILLER为llama.cpp等端侧推理框架提供了极佳的微缩模型测试基座。
7. 学习建议
- 探索协同推理架构:研究者应跳出单一模型推理的框架,学习PyroDash的设计思路,探索基于Token置信度的级联路由机制,结合vLLM等框架实践低成本推理集群搭建。
- 深入SSM与Mamba架构:算法工程师应关注Mamba等状态空间模型在垂直领域(如金融事务、长文本时序)的应用,学习其状态转移机制,掌握非Transformer架构的建模范式。
- 掌握高维空间理论与LoRA变体:结合“维度诅咒”理论,深入学习正交LoRA等参数高效微调技术,理解其在时序持续学习和多任务防干扰中的数学原理。
- 实践可靠性感知蒸馏:对于从事小模型压缩的从业者,建议研读低资源语言蒸馏的负面案例,学习如何在知识蒸馏中引入方差感知和可靠性约束,避免小模型性能崩塌。
📚 附录
筛选关键词
算法: attention mechanism, mixture of experts, MoE, sparse attention, flash attention, rotary position, RoPE, grouped query, GQA, KV cache …
训练: pre-training, pretraining, post-training, fine-tuning, finetuning, supervised fine-tuning, SFT, alignment, RLHF, DPO …
推理: inference, serving, latency, throughput, speculative decoding, batching, continuous batching, PagedAttention, vLLM, quantization …
本报告由 OpenClaw 自动生成 | LLM & SLM Research Daily