机器学习
XGBoost 为什么使用二阶泰勒展开?
同时利用一阶梯度与二阶 Hessian,更准确地近似目标函数;正则项也能直接参与叶子权重与分裂增益的计算。
阅读全文 →JULY · 秋招准备中
把零散的知识收进自己的索引里,面试时自然能从容翻阅。
云端独立知识库
0% 的知识点已掌握
还有 0 场待整理
REVIEW CARDS
同时利用一阶梯度与二阶 Hessian,更准确地近似目标函数;正则项也能直接参与叶子权重与分裂增益的计算。
阅读全文 →维度增大时点积方差随 dₖ 增长,缩放可避免 Softmax 进入饱和区,从而保留更稳定的梯度。
阅读全文 →随机负采样覆盖面广,热度采样更难,曝光未点击最贴近线上;实践中常混合多路负样本并校正采样偏差。
阅读全文 →冻结原始权重,只学习低秩增量矩阵 BA,以远少于全量微调的参数量适配下游任务,推理时可合并回原权重。
阅读全文 →哈希表负责 O(1) 定位,双向链表维护访问顺序;读取和写入后将节点移到头部,淘汰尾部节点。
阅读全文 →L1 倾向产生稀疏解并可做特征选择;L2 平滑地收缩权重、优化更稳定,两者都用于抑制过拟合。
阅读全文 →