可学习位置 “可学习位置”这个术语通常出现在神经网络和深度学习的语境中,它的核心含义是:模型在训练过程中,通过优化算法(如梯度下降)自动调整的参数所存在的位置,这些位置上的值不是由人手动设定的,而是模型从数据中“... wen 2026-06-29 32
正弦余弦固定 你说的是“正弦余弦固定”吗?这听起来像是指正弦函数和余弦函数在特定的角度下,其函数值是固定不变的,确实,有一些特殊角度的正弦和余弦值是常用且必须记忆的,这些值构成了三角函数的基础,核心表格:0°、30... wen 2026-06-29 30
上下文窗口扩展 突破AI大模型记忆瓶颈的革命性技术目录导读技术背景:为什么上下文窗口扩展成为AI领域的“兵家必争之地”?核心原理:从“短时记忆”到“长时记忆”的跃迁机制经典方法:位置编码、稀疏注意力与记忆压缩三大流派... wen 2026-06-29 27
NTK缩放 NTK缩放深度解析:从理论基础到AI应用落地的关键缩放技术目录导读NTK缩放是什么?核心定义与起源NTK缩放的工作原理:为什么它如此重要?NTK缩放与位置编码的协同进化实际应用场景:大模型的长上下文能... wen 2026-06-29 28
扩展位置插值 重塑大语言模型上下文长度的核心技术解析目录导读什么是扩展位置插值? —— 核心概念与原理解读为什么需要扩展位置插值? —— 大模型上下文局限与技术瓶颈扩展位置插值如何工作? —— 技术实现与关键步骤主... wen 2026-06-29 28
YAARN方法 YAARN是一个在中文互联网社区(尤其是游戏、动漫、小说等圈子)中用来分析或吐槽角色、作品情节的网络用语(梗),也是一个创作/分析工具的戏仿,核心定义:“YAARN”并非来自某个学术理论,而是对西方常... wen 2026-06-29 41
长上下文模型 什么是长上下文模型?长上下文模型是指能够一次性处理非常长的输入文本的大语言模型,这里的“上下文”指的是模型在进行推理(生成回答)时,能够“看到”和“的前文信息量,传统模型通常只能处理几千个token(... wen 2026-06-29 41
Claude 100K I think you might be referring to Claude 2 (100K context or the 100K token context window that Anth... wen 2026-06-29 32
大型上下文挑战 AI模型的记忆极限与应用突破目录导读什么是大型上下文挑战?——从技术定义到现实困境的全面解析为什么大型上下文如此重要?——应用场景与商业价值的深度剖析当前技术方案对比——主流模型如何应对长文本处理?核... wen 2026-06-29 32
Gemini 1M Here is the breakdown of Gemini 1M, which refers to the long-context capability (1 million tokens a... wen 2026-06-29 26