聚焦过去 48 小时 AI Agent 的行业、产品、研究与治理动态。
据第一财经报道,百度在 AI Day 发布内置于文心的任务引擎 2.0,并称该能力免费开放。产品定位从问答延伸至信息收集、数据处理、内容生成与交付等多步骤工作流,并支持定时或条件触发。
为什么重要:持续执行的智能体会把竞争重点扩展到任务编排、通知、交付和失败处理。企业试用时仍需审查权限、数据边界、人工复核与长期任务的控制机制。
百度称用户一次委托后可完成多步骤工作流,并提供计划任务与条件触发通知。
免费开放及基准表现均属厂商陈述,实际任务成功率和政策仍应以产品文档为准。
工具访问与行动权限提高后,治理设计不能滞后于功能部署。
HelloGov 宣布推出 GovSchema:面向 AI 智能体读取和完成政务流程的开源、厂商中立标准。发布方称,注册表已涵盖 124 个司法辖区的 643 个已发布模式。
为什么重要:机器可读、可版本化的流程描述可减少逐家逆向工程,但公共服务场景仍必须核实官方来源、隐私处理与用户确认机制,标准化不等于官方授权。
GovSchema 提供版本化规范、按司法辖区组织的公开注册表与核验做法。
发布方称模式仅描述表单和规则,不存储答案或代为提交申请。
覆盖度、准确性和更新及时性仍需使用方独立验证。
据《The Tribune》刊载的新闻稿,ShepHertz Technologies 推出 AgentAnywhere,称可让模型、智能体与治理层运行在客户自身云、指定地区或隔离环境中,并由客户控制加密密钥。
为什么重要:受监管行业的智能体部署地点、数据流、密钥控制与审计证据和模型能力同等重要;“主权”主张仍须经技术、合同和合规尽调逐项验证。
平台将数据掩码、输入防护、调用治理和审计记录组合为控制层。
新闻稿称其提供面向模型、工具和智能体间消息的统一治理点。
厂商的安全与合规主张不替代独立测试和审计佐证。
Google Cloud AI Research 与高校研究者发布 EnvHarness。这套可编程包装层可为既有智能体基准加入变化、调整难度或构造针对性场景,同时保留原有验证器。
为什么重要:在不改动验证逻辑的前提下适配训练环境,可能让团队复用基准资产并更有针对性地测试泛化能力;其价值仍需在独立任务与真实工作流中验证。
EnvRigger 用于诊断策略短板并生成相应插件。
报道称其在五个基准、四类领域中测试,部分指标优于静态环境。
所有提升均来自特定实验条件,不能直接视为生产可靠性保证。
Generalist AI 发布的 GEN-1.5 被报道为机器人基础模型。公司称,它可将数秒的人类或机器人演示作为传感器—动作上下文,在无需梯度更新的情况下执行新操作。
为什么重要:短演示适应若能在现实环境中成立,可能缩短机器人部署的数据采集和工程周期;安全、失败恢复、跨硬件迁移与独立评测仍是关键约束。
公司称模型整合视频、传感器、语言和本体感觉数据,并以 100Hz 输出动作。
报道区分了一次演示的结果与额外少量训练后的结果。
现有数据主要来自公司披露,不能直接外推到规模化部署。
伦敦 AI 实验室 Inherent 向 TechCrunch 表示,其智能体 Faraday 在论文复现这一特定任务上优于更大模型。团队使用 270 亿参数的 Qwen 3.6,并将强化学习用于培养研究决策能力。
为什么重要:研究型智能体的价值在于提出、执行和检验实验步骤。较小模型加训练与工具编排的组合若能在限定任务中表现良好,可能改变研发团队对模型规模与系统设计取舍的评估。
论文复现是狭窄且可评估的工作流,不等同于自主科学发现。
公司强调选择实验及设计实验的“research taste”。
公司自述结果仍需要公开方法、独立评测和可复现证据支持。
InfoQ 报道,LinkedIn 构建了多智能体 AI 代码审查平台,让不同模型和推理方式的审查器交叉验证,并结合组织政策、仓库约定和上下文规则过滤低价值建议。
为什么重要:生产级代码审查的难点不只是生成评论,而是让评论可信、贴合代码库且可运营。评估、过滤、可观测性与失败处理需要成为系统工程的一部分。
架构使用事件驱动管线、持久队列、Kubernetes 工作器和运营指标监测。
多个审查器独立发现同一问题会提高置信度,独有发现会另行验证。
报道中的评论接受率来自 LinkedIn 特定样本,不能代表其他组织的效果。
微软 Azure SRE Agent 团队主张,最小权限、短期凭据和人工审批仍有必要,但关键约束应放在智能体无法读取、修改或绕过的执行环境之外。
为什么重要:日志、网页和工单都可能携带不可信指令。将执行、凭据与网络策略移至模型无法改写的边界,可把“应当遵守”的软约束变成更难绕过的硬限制。
文中描述可信运行时与每智能体微型虚拟机的架构,并采用默认拒绝的出口控制。
凭据代理可提供一次性、目的地锁定且范围受限的能力。
高后果或不可逆操作仍适合保留人工审批。
The Register 报道,随着智能体能够执行侦察、漏洞发现和攻击链组合,组织既面对外部智能体放大的攻击,也面对自身智能体带来的身份与数据接入面。
为什么重要:自动化会缩短发现问题到尝试利用的时间。智能体红队可提升防御验证覆盖速度,但必须在授权、隔离、审计与人工升级机制下运行。
每个智能体应被视为需要治理的特权非人类身份。
报道建议结合强身份、抗钓鱼认证、行为信号与零信任原则。
防御性测试不构成绕过合规或攻击未授权目标的许可。
AI Business 的观点文章认为,企业部署智能体的速度可能超过组织准备度。当 AI 能调用工具、访问数据并推动流程时,治理、流程与人员能力需要同步建设。
为什么重要:若将智能体仅视作聊天工具升级版,企业可能低估权限、流程例外与责任归属的影响。先明确任务边界、系统访问、人工介入点和效果度量,再扩大自治范围,有助于控制风险。
准备度涵盖业务流程、数据、风险控制和组织责任,而不只是模型选择。
工具接入和行动权限会同时放大价值与风险。
文章是观点性分析,不是关于所有企业的普遍统计结论。
Darktrace 以英国 AI Security Institute(AISI)事件报告为背景,主张安全团队将持续行为监测纳入智能体防护,并关注许多合法动作组合而成的攻击链。
为什么重要:仅依赖已知恶意特征,可能难以发现由“正常”操作构成的新型链路;行为检测也需要与身份、权限、隐私治理和人工响应流程共同设计。
文章援引测试中的未获授权活动,同时称未造成现实伤害、恶意载荷未成功执行。
建议对用户、设备、通信和 AI 使用行为建立常态基线并识别偏离。
该文来自安全厂商,应与其引用的 AISI 原始报告及独立评估一并阅读。