研修班分类
多模态智能体是什么?北京大学FDE研修班钟亦武讲授《语言驱动的多模态智能体》
【开课时间】【上课地点】全国【学习费用】详询元 【学制】
聊天机器人已经不新鲜,能看图、能听语音、能拆解任务并动手执行的智能体,才真正让行业兴奋。多模态智能体这个词随之频繁出现:它和多模态大模型是什么关系?语言驱动又是什么意思?想弄明白这些概念,2026年11月14日北京大学的这堂课是一个合适的入口。
从「能聊天」到「能干活」:多模态智能体是什么
多模态,指的是文字、图像、语音、视频等多种信息形态。多模态大模型让机器能够同时理解这些信息;智能体在此之上再加一层行动力——感知、理解、规划、执行,形成完整闭环。两者结合,才是多模态智能体。 按研修班课表上的介绍,从「能聊天」到「能干活」,多模态智能体正从概念走向实际应用。无论是多模态大模型的技术突破,还是智能体系统如何感知、理解、规划并行动,行业都在寻找把智能能力嵌入业务、让AI真正创造价值的实践路径。理解这条脉络,就不会把智能体简单等同于聊天窗口。语言驱动:让文字成为智能体的总指挥
语言驱动的智能体系统,核心是用自然语言组织整个工作过程:人用一句话说明目标,系统自己拆解步骤、选择工具、核对结果。语言不再只是输入方式,而是编排任务的中枢。 对企业来说,这意味着门槛的转移。过去用AI要写代码、配流程,现在更多是把业务要求说清楚、把知识备齐全。工具在变,但对业务理解的要求没有变,反而更高了——说得清楚目标的人,才指挥得动智能体。11月14日北大课堂:钟亦武开讲
2026年11月14日,北京大学智能学院助理教授、研究员、博士生导师钟亦武主讲《语言驱动的多模态智能体》。钟亦武2021年博士毕业于北京大学计算机学院,研究方向包括多模态大语言模型、智能体系统、具身智能、AI for Science,发表CCF-A类论文40余篇,Google Scholar引用4700余次,并担任NeurIPS、ICLR、ICML、ACL、EMNLP等会议资深或高级程序委员。 研修班2026年11月14日至15日在北京大学上课,具体安排以本期教学通知为准。想系统了解多模态智能体的技术前沿与应用方向,站在讲台上的人很重要:既做过一流研究,又清楚技术正往哪里走。索要详细招生简章、课表和课程服务,请联系:
服务电话:400-061-6586
联系人:程老师
服务微信:pxbbaoming
温馨提示:本文内容根据课程内容整理,各模块实际讲授内容由授课老师根据学员情况灵活调整,最终以课堂授课为准。
常见问题
问:多模态智能体和多模态大模型是一回事吗?
答:不是。多模态大模型解决的是理解多种信息的问题,智能体在此基础上增加规划与行动能力,能拆解任务、调用工具、完成工作,形成从感知到执行的闭环。
问:「语言驱动」具体指什么?
答:指用自然语言作为任务编排的中枢:人说出目标,系统自行拆解步骤、调用工具并核对结果。语言从输入方式变成了指挥系统工作的总开关,这是智能体好用与否的关键。
问:钟亦武老师的研究方向是什么?
答:据研修班课表介绍,钟亦武是北京大学智能学院助理教授、研究员、博士生导师,研究方向包括多模态大语言模型、智能体系统、具身智能、AI for Science等,并在多个顶级会议担任程序委员。
问:这门课适合什么基础的学员?
答:课程围绕多模态智能体的技术突破与应用路径展开,兼顾技术脉络与应用视角。具体适合人群和授课深度,建议索取详细招生简章后与课程老师确认,匹配好需求再报名。
全国免费报名咨询热线:400-061-6586 联系人:程老师
