码厩开发者笔记

coding in a complicated world

Agent

关注 · Tag · 3 条

GPT-6 Sol Codex系统提示词遭泄露,近30万字符内容流出

据公开信息,OpenAI于9月23日发布GPT-6 Sol,主打复杂代码推理和长线Agent工作流。产品发布后不久,外部爆料者公开了GPT-6 Sol Codex版本的系统提示词及工具定义,内容长达约29.4万字符,包含指令模板、工具调用规范、任务执行机制和代码审查规则等。

泄露内容显示,Codex被设计为具有较高自主性的编程Agent,包括并行执行独立任务、动态加载技能、处理Git冲突、创建隔离工作区及草稿PR等能力。同时,系统还设计了长任务上下文管理机制,要求模型在上下文窗口耗尽前保存任务目标、决策和进度,并通过后台运行及心跳机制持续执行任务。

社区对这份提示词的价值看法不一。一些开发者认为其中包含大量成熟的Agent工程实践,也有人认为提示词本身并非核心技术。更值得关注的是,其背后涉及工具调用、权限控制、上下文管理、任务调度和结果验证等完整工程体系。单纯复制系统提示词,并不能直接复刻Codex的实际能力。

DeepSeek Harness发布0.2.1-alpha.1,新增实验性Claude Code Mods兼容层

10月3日,DeepSeek Harness(DSH)发布v0.2.1-alpha.1版本,新增实验性的Claude Code Mods兼容层。该功能由团队负责人崔添翼开发,主要用于验证Claude Code Mods API与DSH“一切皆插件”架构之间的兼容能力。

从技术实现来看,该兼容层本质上是跨运行时的API语义桥接层,可将Claude Code Mods定义的TypeScript Hook函数映射至DSH基于Cordis微内核构建的事件总线和生命周期机制。

目前该功能仍处于Alpha阶段,并非完整兼容方案。官方演示显示,Token Weather、Blast Radius、Replay Theater等基准用例已经可以运行,但Claude Code内置的diff面板、agents.md等功能受架构差异影响暂不支持。

DSH方面表示,推出兼容层主要是为了验证其插件化架构能否承接外部扩展原语,并探索“Agent自进化”和让Agent自主编写插件的“创造模式”。目前不建议将其用于完整迁移Claude Code插件生态。

Redis之父antirez质疑Jev热度,两小时复现引发AI模型护城河讨论

近期,TypeSafe AI推出的Jev模型因主打结构化决策而受到开发者关注。Jev不生成自由文本,而是针对预先定义的选项进行选择、评分或概率判断,官方强调其低延迟、低成本以及适合软件自动化决策等特点。

9月21日,Redis之父Salvatore Sanfilippo(antirez)公开质疑围绕Jev形成的高热度。他表示,Jev或许存在一些狭窄应用场景,但当前讨论中的关注度与技术实际影响之间可能存在较大落差。其他开发者也指出,Jev的“零幻觉”主要意味着输出严格遵守预定义格式,并不代表模型不会做出错误判断。

与此同时,开源开发者基于Qwen等模型在较短时间内实现了类似Jev的模型。部分测试显示,其在特定数据集上的准确率接近Jev,但在域外数据测试中差距明显扩大。这意味着Jev真正的技术价值可能并不只是受限输出,而在于决策准确性、概率校准和跨领域泛化能力。

目前,Jev的训练方法和完整评测体系尚未全部公开,其实际护城河仍有待更多独立测试验证。