智东西作者 陈骏达编辑 云鹏
智东西10月9日报道,今天凌晨,在Gemini at Work 2026大会上,谷歌云正式推出企业通用智能体Gemini Agent,试图将原本分散在办公软件、数据平台和开发工具中的任务,交给一个能够自主规划、调用工具并持续执行的智能体。
(资料图)
Gemini Agent的能力不再局限于回答问题或生成一段文本。用户可以直接用自然语言描述最终目标,让智能体自行拆解任务、调用企业数据、编写和运行代码、生成文档与多媒体内容,并在云端持续推进复杂工作。
面对大型任务,它还能够组织多个子智能体协同执行,甚至以拥有独立企业身份的数字同事参与团队协作。
以准备PPT材料为例,用户可以直接要求Gemini Agent制作PPT、搭建收入预测模型,并生成配套宣传视频。智能体需要自行理解目标,调用相应的技能、企业数据和生成模型,完成各个环节,再将结果交付给用户。
在这一过程中,用户仍然可以检查进度、调整要求并决定是否授权关键操作,但不必一直守在电脑前,逐步指导每个执行步骤。
为了让智能体进入企业日常工作,谷歌云还围绕Gemini Agent补齐了四重记忆机制、跨平台协作、企业数据访问、安全隔离和成本控制等能力,形成一套能够将企业任务从指令推进到执行结果的智能体系统。
Gemini Agent的这一产品形态让人联想到国内的豆包工作、腾讯WorkBuddy和阿里的千问办公等产品,同样是办公智能体平台,同样主打“自主拆解任务、调用工具、持续推进工作”。
不过,需要注意的是,Gemini Agent是一款企业级产品,目前尚未公布具体的正式商用日期与定价方案,仅面向部分企业用户开放预览。
一、从对话到执行,Gemini Agent要做企业的通用同事
过去,企业中的AI能力通常分散在不同产品中:有人使用聊天机器人撰写文案,有人借助编程助手处理数据,还有人通过办公软件中的AI功能制作演示文稿。
Gemini Agent希望把这些能力整合到统一的智能体中,让同一智能体能够处理知识问答、文档生成、代码执行和多媒体创作等不同任务。
在使用入口上,谷歌云其延伸至Web、移动端、桌面端和命令行等环境,并推动智能体与Google Workspace、Microsoft 365、Slack等工作工具协同,还可以通过MCP接入其他服务。用户可以在日常工作环境中调用智能体,而不必每次都从头交代背景。
Gemini Agent还面向金融服务和法律行业提供专业化的版本,能更好地完成相关领域的任务。
长跨度任务是Gemini Agent试图突破的另一道门槛。
普通聊天机器人通常围绕当前对话工作,一旦任务涉及多个系统、较长执行时间或反复验证,就需要用户不断跟进。Gemini Agent则依托云端运行环境维持任务状态,使部分复杂工作能够在用户离开电脑后继续推进。
例如,数据分析任务可以经历数据提取、代码生成、模型训练、结果检查和报告整理等多个阶段。智能体不必在每一步完成后都等待用户重新下达指令,而是可以按照既定目标继续执行,并在遇到需要判断或授权的环节时寻求用户介入。
谷歌云还为Gemini Agent引入动态多智能体协同机制。当任务规模较大时,系统可以将工作拆分给多个子智能体,分别处理数据、代码或内容生成等环节,再汇总执行结果。
除了由员工主动发起任务,谷歌云还提出了数字同事(Coworker Agent)的概念。
这类智能体可以拥有独立的企业邮箱、专属存储空间和公司目录身份,并参与邮件与文档协作。借助相应的授权机制,它能够以团队成员的工作身份承担持续性任务,而不只是等待员工打开聊天窗口后才开始工作。
例如,企业可以将某些周期性的资料整理、信息汇总或邮件准备工作交给智能体,让它按照既定规则持续推进。
二、四重记忆让智能体理解企业,支持Gemini、Claude等模型
要让一个智能体长期参与企业工作,仅能理解当前指令还不够。它还需要记住用户正在处理什么任务、企业内部如何定义业务指标,以及过去的工作流程通常怎样执行。围绕这一问题,谷歌云提出了四类记忆机制,并将模型选择与具体任务进一步解耦。
四类记忆分别解决不同问题:
第一类是会话记忆(Session Memory),用于保留当前任务或对话的上下文,避免用户反复解释同一件事。
第二类是语义记忆(Semantic Memory),用于组织企业知识和业务概念,帮助智能体理解公司内部的术语、数据定义与知识关系。
第三类是程序记忆(Procedural Memory),用于沉淀工作流程和执行方法,让智能体能够复用经过定义的任务步骤。
第四类是情节记忆(Episodic Memory),用于记录与过去任务有关的经历和结果,为后续工作提供参考。
这四类记忆并非简单地把所有历史对话存进一个更大的上下文窗口,而是尝试区分不同类型的信息,让智能体在需要时调用相应背景。
例如,当员工要求生成一份销售分析报告时,智能体不仅需要理解本次指令,还需要知道公司对销售额、利润率等指标的定义,了解报告应采用的格式,并参考相关历史任务中的执行经验。
对企业而言,这类能力的价值在于减少重复交代背景的成本。不过,记忆能否准确、持续地发挥作用,仍取决于企业知识质量、权限设置和信息更新机制。
在模型层面,谷歌云则希望避免企业智能体被某一个模型完全绑定。
Gemini Agent支持在谷歌自有模型以及Anthropic Claude等第三方模型之间进行选择,并通过智能路由将不同任务分配给适合的模型。相对简单的工作可以交由成本更低的模型处理,复杂推理任务则可以调用更强的模型。
谷歌云称,采用智能路由后,相关任务的综合运行成本可以降至全部使用前沿模型时的1/3,执行速度提升40%。
在底层模型方面,谷歌也提到了上周发布的Gemini 4 Argon。该模型面向复杂推理和长跨度软件工程任务,在相关基准测试及谷歌内部工程应用中取得进展,为智能体执行复杂工作提供模型能力支撑。
三、企业数据不再只是存储资产,谷歌云补齐智能体的数据底座
影响智能体能否投入生产环境的,还有它能否准确调用数据、持续执行流程,并在整个过程中遵守企业规则。
谷歌云为Gemini Agent打造了多个面向具体场景的Skill。运营报告Skill可以让用户通过简单的对话了解企业运营数据,机器学习Skill则可以在AI开发场景中发挥作用。
智能体需要自主执行任务,就必须能够理解和使用企业数据。然而,大量企业信息仍然散落在数据库、云存储、办公文档和业务系统中。即使模型本身足够强大,如果无法理解数据含义或获得适当访问权限,也很难完成端到端的业务任务。
谷歌云此次为Gemini Agent整合了Knowledge Catalog、Smart Storage和Borderless Lakehouse等能力,试图降低智能体使用企业数据的门槛。
Knowledge Catalog的重点,是帮助智能体理解数据背后的业务语义。
企业中的同一个指标,可能在不同系统中采用不同字段名称或计算方式。例如,员工提出查询“净利润率”,智能体不仅需要找到相关数据,还需要知道企业对这一指标的具体定义,以及相应的数据来自哪里。
通过Knowledge Catalog,谷歌云希望将业务概念与底层数据结构关联起来,并兼容Databricks、dbt、Looker建模体系及SAP等企业数据环境。这样,智能体在执行分析任务时,就能依据企业已有的业务定义定位数据,而不是完全依赖字段名称猜测含义。
在大会演示中,数据科学智能体根据自然语言指令提取数据、生成代码并训练XGBoost模型,展示了从业务问题到机器学习分析结果的自动化流程。
Smart Storage则将AI能力延伸至非结构化文件。图像、PDF和扫描文档通常缺少可直接用于检索的结构化信息,企业即使保存了大量资料,也不一定能快速找到真正有用的内容。
谷歌云希望借助Gemini对这些文件进行上下文理解与标注,让智能体能够从存储中的资料提取相关信息。
例如,Snap将Prism智能体与存储归档连接,用于技术诊断和故障排查。谷歌云披露,该方案将相关排查时间从30分钟缩短至30秒。日立则利用HMAX智能体比对生产现场工序前后的接线照片,帮助一线人员识别差异,获得30%的生产力提升。
另一项能力Borderless Lakehouse,针对的是企业跨云数据分散的问题。谷歌云希望在不要求企业统一搬迁数据的情况下,联合查询Amazon S3、Azure Data Lake、Salesforce和Workday等不同数据源,并减少跨云数据移动带来的成本与复杂性。
企业不必先将所有数据迁移到单一平台,再开始部署智能体,而是可以逐步让智能体访问现有数据资产。
四、智能体自主行动后,安全与成本成为关键
当AI从生成内容走向调用工具、运行代码和操作业务系统,企业面临的风险也随之变化。
一个只能回答问题的聊天机器人,通常不会直接修改生产系统;一个能够持续执行任务的智能体,却可能在获得权限后访问文件、调用接口、运行程序,甚至触发跨系统操作。
因此,谷歌云将身份管理、执行隔离、网络流量控制和成本管理纳入Gemini Agent的企业治理体系。
首先,每个智能体都可以拥有独立的身份与相应权限,其执行操作能够被记录并纳入审计,包括调用虚拟机运行代码等环节。这使企业有机会追踪智能体做过什么、访问了哪些资源,以及相关操作发生在何时。
其次,谷歌云还为Gemini Agent配备了Agent Sandbox和Agent Gateway。前者用于隔离智能体执行任务的环境,后者负责管理智能体进出系统的网络流量,并对恶意指令和不符合权限要求的数据访问进行拦截。
例如,企业可以针对特定文件设置访问限制,避免智能体因收到不当指令而读取无权访问的敏感资料。对于需要运行代码的任务,隔离执行环境也有助于降低不受控操作对其他系统的影响。
成本控制同样重要。智能体执行长跨度任务时,可能反复调用模型、工具和云端运行环境。如果没有预算约束,复杂任务很容易产生难以预估的费用。
谷歌云提供了项目级实时支出上限(Spend Caps),管理员可以设定预算阈值,并在触及上限后暂停相关任务,再根据情况恢复执行。结合模型智能路由,企业可以尝试在任务质量、响应速度与运行成本之间取得平衡。
结语:谷歌云补齐拼图,但真正的考验才刚开始
谷歌云此次发布的Gemini Agent,补齐了他们在企业级智能体赛道的业务布局。此前,OpenAI和Anthropic等AI模型企业已经先行一步押注了企业级智能体赛道,并抢占了一定的用户心智。
要在这一竞争激烈的市场里拿下更多份额,谷歌云需要证明Gemini Agent能在权限治理、跨系统集成、成本透明度等企业用户关心的场景,做出经得起生产环境检验的答案,而不只是发布会上的演示。