文章·AI 底层工程·2026年7月28日·阿新聊ai自进化到底是什么——参数、结构、策略、prompt、代码五个层级TL;DR: 自进化 = 系统把自己运行产生的输出或行为当作学习信号,反过来修改自身的某个部分,从而在不需要外部新标注的前提下变得更好。本文建立两个全系列地基:五层级模型(参数、结构、策略、prompt、代码)和统一四步循环(采集→变异→…自进化前沿Meta Learning
文章·AI 底层工程·2026年7月28日·阿新聊ai扩散模型:从噪声到图像——DDPM、潜在扩散与 Stable Diffusion 的完整路径TL;DR: 扩散模型通过"加噪声→学习去噪声"的过程来生成图像。本文从数学基础(前向扩散、反向去噪的推导)开始,经过 DDPM 的训练与采样算法,到 Stable Diffusion 的潜在空间架构,再到 DiT 和 Flow Matc…扩散模型DDPMStable Diffusion
文章·AI 底层工程·2026年7月28日·阿新聊ai强化学习:MDP、Q Learning、Policy Gradient 与 RLHF——RL 的核心框架TL;DR: 强化学习是让智能体通过与环境交互来学习最优行为策略的方法论。本文从马尔可夫决策过程(MDP)讲起,经过Q Learning和Policy Gradient,最终连接到当前大模型训练的核心技术RLHF。强化学习RLHFPolicy Gradient
文章·AI 底层工程·2026年7月28日·阿新聊ai大模型的缩放定律:Scaling Law、Chinchilla、MoE,为什么模型越大越好TL;DR: Scaling Law 描述了语言模型损失如何随参数量(N)、数据量(D)和计算量(C)的幂律关系变化。OpenAI 在 2020 年发现 $L(N) \propto N^{ 0.076}$——参数量每增加 10 倍,损失下…Scaling LawChinchillaMoE
文章·AI 底层工程·2026年7月28日·阿新聊aiTransformer 详解:自注意力、多头注意力、位置编码,逐层拆解TL;DR: Transformer 完全基于注意力机制,不使用 RNN 或 CNN。它的核心是 Scaled Dot Product Attention:用 Query 和 Key 的点积(除以 $\sqrt{d k}$)计算注意力权重…Transformer自注意力大模型
文章·AI 底层工程·2026年7月28日·阿新聊aiAttention 机制:为什么 Attention 比 RNN 好,Query / Key / Value 是什么TL;DR: Attention 机制的核心操作是:用 Query 和所有 Key 计算相似度,得到权重,然后对 Value 做加权求和。它让序列中的每个位置可以直接"看到"所有其他位置,不需要像 RNN 那样逐步传递信息。Query/K…AttentionNLP序列建模
文章·AI 底层工程·2026年7月28日·阿新聊aiCNN 基础:卷积、池化、感受野——为什么图像不用全连接TL;DR: 全连接网络处理图像时参数量爆炸——一张 224x224 的图片展平后有 150,528 个像素,第一个隐藏层如果有 1000 个神经元就是 1.5 亿个参数。CNN 通过三个核心设计解决了这个问题:局部连接(每个神经元只看图…CNN卷积计算机视觉
文章·AI 底层工程·2026年7月28日·阿新聊ai反向传播:计算图、链式法则,以及梯度如何一层层传回去TL;DR: 反向传播(Backpropagation)不是一个新算法,它就是链式法则在计算图上的高效应用。前向传播把数据从输入推向输出,计算出预测值和损失。反向传播把梯度从输出拉回输入,告诉你每个参数该怎么调。核心规则只有一条: 下游梯…反向传播梯度计算图
文章·AI 底层工程·2026年7月28日·阿新聊ai神经网络入门:从感知机到多层网络,通用近似定理,以及为什么需要深层TL;DR: 感知机是神经网络的最小单元——一个线性函数加一个阈值判断。单层感知机只能解决线性可分问题(连 XOR 都搞不定),但把多层感知机堆叠起来就能逼近任何连续函数——这就是通用近似定理。然而浅层网络要逼近复杂函数可能需要指数级的神…深度学习神经网络感知机
文章·AI 底层工程·2026年7月28日·阿新聊ai评估指标全解:准确率、精确率、召回率、F1、AUC ROC,以及什么时候看哪个TL;DR: 准确率在不平衡数据上会骗人——99% 的准确率可能只是因为你的数据里 99% 都是负样本。精确率关注"预测为正的有多少是对的",召回率关注"实际为正的有多少被找到了"。F1 是两者的调和平均。AUC ROC 衡量模型区分正负…评估指标准确率AUC