本窗口最密集的软件工程信号:系统提示/上下文工程与 harness 动态组装、Spec-Driven Development 与 Loop Engineering 方法论、生产级 agent harness 与回归治理、模型路由与成本分层(Fable 价格 vs GLM)、编程 Agent 驱动跨平台框架回迁原生、Copilot/Claude Code/Gemini CLI 工…
LLM 推理正从「自由文本生成」分裂出「决策模型(System One)」这一独立范式:Laya(Apache 2.0 开源)与 Jev(托管 API)均以 state+questions 输入、直接返回带校准概率的 choice/score,前向仅几十毫秒,宣称比通用 LLM 快约 194 倍、便…
HashiCorp发布用零信任工具Boundary安全地让AI智能体访问基础设施的架构方案(含IBM watsonx+Granite演示)
阿里发布Qwen Intelligence,面向手机厂商提供模型+Agent平台+三个Agent的手机全栈AI解决方案,与荣耀深度合作。
chDB发布Durable Layer:嵌入式OLAP引擎新增持久化层,让agent记忆状态可跨机器/CI/沙箱恢复到对象存储。
NVIDIA发布Open Agent Safety Platform,结合OpenShell运行时与BlueField/DPU硅内监控,为智能体提供零信任安全层。
OpenAI用数千Agent暴力求解Navier-Stokes存在性难题,数学家群体强烈反弹,25位菲尔兹奖得主签署声明抗议"AI杀死数学艺术"。
把 Agent 循环里那些「输出短、频率高」的判断(工单分类、路由、门控、验证)从主干 LLM 调用链中拆出来,改用非自回归决策模型(开源的 Laya,或托管 Jev 类 API)。这类模型前向只需几十毫秒、返回带校准概率的类型化结果,能显著降低多轮 Agent 的延迟与 token 开支。先在自己有标签的样本上做小规模 A/B,别照搬别家阈值。
「Agent 评测」进入测量效度祛魅期:多智能体代码裁判在证据不再满足独立性假设(从检索迁移到代码评审)时,宣称准确率被证伪——声称两种解答相同达 78-95%,精度仅 4.4%(直接询问同模型为 43.7%)。同时「有护栏的验证型 Agent」开始引入「主动拒答」机制而非盲目高置信度输出,这预示评测体系从「答案准确率」转向「何时该说不知道」的校准新维度。