Skip to content

文章归档186 篇

知识的沉淀 · 成长的足迹

2026 年

47 篇
AppWorld Skill与经验知识相关
AppWorld 相关论文总结
16-技巧
15-多维DP
14-动态规划
写题常用
13-贪心
12-堆
11-栈
10-搜索
09-回溯
08-图相关
相似题目汇总
SWE 其他相关工作
On Policy Distillation
Claw SFT 训练相关
SWE 环境相关
Claw Bench
一些疑难杂症
SWE 相关技巧
07-二叉树
06-链表
05-矩阵
04-数组
03-滑动窗口
02-双指针
01-Hash
Qwen3.5 RL 环境踩坑
Agent 安装记录
NanoAgent 核心笔记
SWE 主流开源数据
常见模型架构参数汇总
AppWorld 合成数据相关
SWE-MidTrain 方法
AgentRL 目录
AppWorld 上下文相关
AppWorld Agent框架相关
AppWorld 训练相关
MiniSWE-Agent Scaffold
Openhands Scaffold
SWE 任务简介
训练观测指标
常见命令
SWE-数据合成及SFT方法
SWE 合成数据 系列
SWE 笔记索引
SWE 总结索引

2025 年

66 篇
快手系列
腾讯系列
Code 全训练 论文阅读
Code TaskRL 论文阅读
CodeLLM 索引简记
Code 安全相关
Code RL 任务
Code 任务Bench相关
Code Survey
Claude 系列
LongCat 系列
Gemini 系列
Seed 系列
OpenAI 系列
Qwen 系列
Verl 训练流程源代码阅读
Verl 有趣的功能
Verl AgentLoop Rollout 相关
LLM位置编码和长度外推系列
Agent-RL 相关算法
LLM 解码相关
LLM Attention 系列
LLM Attention 系列
MiniMax 系列
熵和RL相关文章
GRPO 改进系列
Verl 常见参数配置和理解
GLM 系列
PPO 改进系列
Verl 早期概念型学习文章
典型策略提升方法:TRPO+PPO+DPO+GRPO
确定性策略梯度
Actor-Critic 算法
策略梯度算法
DQN算法及进阶
免模型预测和控制
有模型预测和控制
马尔可夫决策过程
强化学习基本概念
推理优化技术
分布式训练框架
分布式并行策略
DeepSeek 系列
Kimi 系列
LLM 基础知识
LLM 架构相关
Transformer细节
语言模型重要组件
DeepResearch 评估
shell 命令行
Computer-Agent
Agent-Interaction-RL 笔记
Agent-Search-RL 笔记
Agent-Tool-RL 笔记
Agent-RL 综述型笔记
博客搭建的一些坑
Agent 思考性文章
一些流行的Agents
Agent 评估 Benchmarks
Agent基础概念 (李宏毅笔记)
SkyWork 系列
小米系列
Nvidia 系列
SWE-Agent-RL训练方法
SWE 训练方法 系列
Code 预训练相关

2019 年

2 篇
机器阅读(二)--模型(未完成)
机器阅读(一)--整体概述

2018 年

33 篇
BERT 详解
OpenAI GPT:Improving Language Understanding by Generative Pre-Training
ELMo:Deep Contextualized Word Representations
QANet
Transformer
Bidirectional Attention Flow
R-Net (Gated Self-Matching Networks)
Match-LSTM and Answer Pointer
强化学习在NLP中的应用
意图识别和槽填充
(18年笔记)强化学习算法小结
强化学习算法小结
(18年笔记)基于策略函数的学习方法
基于策略函数的学习方法
(18年笔记)基于值函数的学习
基于值函数的学习
阅读理解模型总结
卷积神经网络总结
(18年笔记)强化学习基础
强化学习
阿里小蜜论文
网络优化
各种注意力总结
Dynamic Coattention Network (Plus)
协同注意力简介
使用Dynamic Memory Network实现一个简单QA
决策树笔记
机器学习知识点汇总整理
剑指offer4(51-64)
SVM笔记
IDE配置
Linux使用笔记
剑指offer3(21-40)

2017 年

38 篇
数据结构之搜索算法
树的总结
leetcode-01
剑指offer(11-20)
排序算法总结
C++类对象和指针的区别
cs224n作业一
词性标注和句法依存的表示符号
cs231n线性分类器和损失函数
神经网络-过拟合-预处理-BN
神经网络基础-反向传播-激活函数
Word2vec之总体介绍
Word2vec之数学模型
Word2vec之公式推导笔记
subword-units
Wordpiece模型
循环神经网络
谷歌RNN翻译模型
博客搭建及相关问题
机器翻译注意力机制及其PyTorch实现
图文介绍RNN注意力机制
PyTorch快速上手
最初RNN神经翻译简略笔记
条件随机场
最大熵模型
线性回归和逻辑回归
最大期望算法
马尔可夫模型
语言模型和平滑方法
剑指Offer(1-10)
利用tensorflow实现简版word2vec
朴素贝叶斯算法及其代码实现
NumPy
Spark基础编程核心思想介绍
Spark-SQL的简略笔记
旧版博客搭建过程及其问题
Spark键值对RDD的常用API
Spark基础RDD的常用API
总访客数:— · 总访问量:—
PLM's Blog @ 2016 - 2026