我的征尘是星辰大海。。。
The dirt and dust from my pilgrimage forms oceans of stars...
-------当记忆的篇章变得零碎,当追忆的图片变得模糊,我们只能求助于数字存储的永恒的回忆
作者:黄教授
手机视频列表
工程化框架决定模型能力的下限而模型天赋决定模型能力的上限
视频
音频
原始脚本
工程化框架决定模型能力的下限,而模型本身的先天禀赋决定了能力的上限。 偶然从 VS Code 里翻出 Copilot 一段 JSON 格式的对话存档。 短短几行结构化数据却像一把钥匙,打开了关于大模型能力本质的一连串思考。 从模型看似有主见的行为表现,到架构设计的工程逻辑。 再到国内外模型差距的根源,一路梳理下来,既有对技术本质的清晰认知,也有对行业现状的冷静审视,更有对追赶之路的理性期待。 这段存档里没有普通的聊天文本,只有一条条按时间串联的事件记录。 绘画启动,用户提问, AI 开启思考轮次,调用工具读取文件。 输出推理过程,结束单轮思考。 清晰的 turn 下划线 start 与 turn end 完整的 reasoning text 内心推理、链式关联的 parent id 上下文。 构成了一套完整的事件溯源存储结构。 从工程角度看,这套机制一点都不高深。 任务拆解,多轮思维链。 上下文聚焦、进度跟踪、回滚修正、跨轮次恢复。 本质上是思维链的固化,Langchain 架构的简化版,也是 RAG 系统的互补形态。 任何有一定技术实力的大模型公司,都有能力搭建出类似框架。 毕竟模型预训练的复杂度远高于这套工程化调度逻辑。 照理来说,国内的 Deepseek 豆包等一众大模型产品,完全可以借鉴这套模式,给模型装上有条理做事的框架。 可实际体验却差距显著。 以 GPT 5.4为代表的模型早已摆脱被动应答的状态,像一个成熟的工程助手,接到问题不会盲目动手,先自查现有代码实现。 自主规划排查步骤,定位资源耗尽的核心问题,给出严谨可行的优化方案,全程逻辑清晰,有章法,有主见。 而不少模型即便套用了相似架构,依旧表现被动,容易跑偏。 要么抓不住问题核心,要么细节漏洞百出,甚至陷入盲目讨好式应答。 完全没有自主判断和深度推理的能力。 这就引出了最核心的结论,工程化框架决定模型能力的下限,而模型本身的先天禀赋决定了能力的上限。 所谓模型的先天,是预训练阶段奠定的底层能力,海量高质量代码数据的浸润架构带来的逻辑连贯性,长城推理的稳定性。 对系统工程的深度理解,这就像人的天赋。 有的人天生逻辑缜密,一点就透。 有的人即便学习相同的知识,思路也始终零散混乱。 这套底层能力无法靠后期的 Agent 的框架对其调教,凭空弥补,是模型胎里带的核心竞争力。 而工程化手段是给模型搭建护栏与 SOP 流程,规范行为,强制步骤,稳定工具调用,实现自我校验。 目的是兜底下限,让模型不至于乱说话、漏步骤、凭空幻觉。 但这套工程篱笆的搭建看似简单,实则需要海量真实场景打磨、无数次踩坑优化,绝非抄个结构就能成型。 反观国内编程大模型的现状。 难免让人理性悲观。 先天禀赋不足,后天工程兜底也不够牢固。 一方面,模型底层的代码理解、逻辑推理、系统调试能力。 与顶尖水平存在实质差距,上限难以企及。 另一方面,工程化的行为规范、调度框架对其优化尚未打磨成熟,连可用靠谱的下限都没能完全兜住。 最终呈现出两头偏弱的局面。 但悲观从不是终点,先天不足更不代表没有机会。 人与人之间的差距从来不是只靠天赋决定。 资质平平的人,通过严苛的训练、规范的引导、持续的打磨,也能成长为堪当大任的人才。 模型亦是如此。 即便底座禀赋存在差距,只要在工程化上深耕细作,扎牢行为护栏,优化调度逻辑,打磨对齐细节,就能不断抬升能力下限。 同时在预训练数据架构优化、逻辑训练上持续重投入,死磕核心技术,逐步缩小先天差距。 光抱怨差距毫无意义,先天不足,唯有后天加倍努力弥补。 国内大模型公司尚且任重道远,既需要沉下心打磨模型底座的核心能力,也需要耐住性子做好工程化的脏活累活。 这条路注定漫长且艰难,但只要方向清晰,持续深耕,一步一个脚印补齐短板,终究能在强手林立的赛道中追赶上属于自己的步伐。 技术的竞争从不是一时的快慢,而是长久的坚持与深耕。 先天不够,后天来凑,努力终会照亮追赶的路。
修正脚本
工程化框架决定模型能力的下限,而模型本身的先天禀赋决定了能力的上限。 偶然从 VS Code 里翻出 Copilot 一段 JSON 格式的对话存档。 短短几行结构化数据却像一把钥匙,打开了关于大模型能力本质的一连串思考。 从模型看似有主见的行为表现,到架构设计的工程逻辑。 再到国内外模型差距的根源,一路梳理下来,既有对技术本质的清晰认知,也有对行业现状的冷静审视,更有对追赶之路的理性期待。 这段存档里没有普通的聊天文本,只有一条条按时间串联的事件记录。 会话启动,用户提问, AI 开启思考轮次,调用工具读取文件。 输出推理过程,结束单轮思考。 清晰的 turn 下划线 start 与 turn end 完整的 reasoning text 内心推理、链式关联的 parent id 上下文。 构成了一套完整的事件溯源存储结构。 从工程角度看,这套机制一点都不高深。 任务拆解,多轮思维链。 上下文聚焦、进度跟踪、回滚修正、跨轮次恢复。 本质上是思维链的固化,Langchain 架构的简化版,也是 RAG 系统的互补形态。 任何有一定技术实力的大模型公司,都有能力搭建出类似框架。 毕竟模型预训练的复杂度远高于这套工程化调度逻辑。 照理来说,国内的 Deepseek 豆包等一众大模型产品,完全可以借鉴这套模式,给模型装上有条理做事的框架。 可实际体验却差距显著。 以 GPT 5.4为代表的模型早已摆脱被动应答的状态,像一个成熟的工程助手,接到问题不会盲目动手,先自查现有代码实现。 自主规划排查步骤,定位资源耗尽的核心问题,给出严谨可行的优化方案,全程逻辑清晰,有章法,有主见。 而不少模型即便套用了相似架构,依旧表现被动,容易跑偏。 要么抓不住问题核心,要么细节漏洞百出,甚至陷入盲目讨好式应答。 完全没有自主判断和深度推理的能力。 这就引出了最核心的结论,工程化框架决定模型能力的下限,而模型本身的先天禀赋决定了能力的上限。 所谓模型的先天,是预训练阶段奠定的底层能力,海量高质量代码数据的浸润,架构带来的逻辑连贯性,长程推理的稳定性。 对系统工程的深度理解,这就像人的天赋。 有的人天生逻辑缜密,一点就透。 有的人即便学习相同的知识,思路也始终零散混乱。 这套底层能力无法靠后期的 Agent 框架对其调教,凭空弥补,是模型胎里带的核心竞争力。 而工程化手段是给模型搭建护栏与 SOP 流程,规范行为,强制步骤,稳定工具调用,实现自我校验。 目的是兜底下限,让模型不至于乱说话、漏步骤、凭空幻觉。 但这套工程篱笆的搭建看似简单,实则需要海量真实场景打磨、无数次踩坑优化,绝非抄个结构就能成型。 反观国内编程大模型的现状。 难免让人理性悲观。 先天禀赋不足,后天工程兜底也不够牢固。 一方面,模型底层的代码理解、逻辑推理、系统调试能力。 与顶尖水平存在实质差距,上限难以企及。 另一方面,工程化的行为规范、调度框架的优化尚未打磨成熟,连可用靠谱的下限都没能完全兜住。 最终呈现出两头偏弱的局面。 但悲观从不是终点,先天不足更不代表没有机会。 人与人之间的差距从来不是只靠天赋决定。 资质平平的人,通过严苛的训练、规范的引导、持续的打磨,也能成长为堪当大任的人才。 模型亦是如此。 即便底座禀赋存在差距,只要在工程化上深耕细作,扎牢行为护栏,优化调度逻辑,打磨对齐细节,就能不断抬升能力下限。 同时在预训练数据架构优化、逻辑训练上持续重投入,死磕核心技术,逐步缩小先天差距。 光抱怨差距毫无意义,先天不足,唯有后天加倍努力弥补。 国内大模型公司尚且任重道远,既需要沉下心打磨模型底座的核心能力,也需要耐住性子做好工程化的脏活累活。 这条路注定漫长且艰难,但只要方向清晰,持续深耕,一步一个脚印补齐短板,终究能在强手林立的赛道中追赶上属于自己的步伐。 技术的竞争从不是一时的快慢,而是长久的坚持与深耕。 先天不够,后天来凑,努力终会照亮追赶的路。
英文翻译
back to top