概述:姓名,南开,计算所,导师;
研究兴趣:硕士 GCL, 博士MAS;
成果:
硕士:sigir2024, 提升GCL的跨领域泛化能力; sigir2025,从PU的视角分析GCL,发现了采样偏差导致了OOD差;借鉴PU的理论,利用InfoNCE的中间值缓解了采样偏差,提高了OOD能力;
博士:ACL2026, 指出并非总是需要query-level workflow、task-level的方法瓶颈在评估计算消耗大;提出了一种能够大幅度降低token消耗,同时维持workflow效果的task-level的workflow优化算法。
在研项目:
MARL中的奖励分配; Human-Agent协作对人的基础能力的影响;→ 我负责其中由agent代表受实人类的实验部分,具体是在RL中分配给代替人类的agent固定角色,测试训练前后agent基础能力的变化,反应人类能力受到的影响。基础能力:逻辑一致性、内容完备性之类的;本质上是multi-turn的rl;
self-attn:并行,显示依赖建模;点积会聚合单个特征的方差,所以需要除以标准差;
mask: 因果mask在softmax前,才是真的mask掉,不分概率;
MHA:不同模式,不同关注,表达能力提升;
GQA, MQA: 多头共享一组K,V 参数, 或者分组,每组共享一组参数;
复杂度:O(n^2); Spare-attn, local-attan, linear-attn
position_emb: 绝对、相对(RoPE)
LN: 和batch-size无关;可学习;数值稳定;训推一致
pre-norm:在attn前做norm,更稳定;
KV-cache:增量地算和存K,V;空间换时间;空间极大,和层数、总的hidden维度、batch-size、seq-len都正相关;
decode:贪心、beam稳定;温度、top-p灵活,可调整;
ppl = exp(avg-CE)
enc-only for understanding; dec-only for general task; Enc-Dec: 源到目标的映射,如翻译
DP,TP(一层内的模型分片),PP, FSDP(params,grad, optimizer都分片)