2026-06-02 0
在人工智能技术快速发展的今天,清华大学团队推出创新性多模态智能体框架Syll,为解决个人AI智能体应用难题提供了全新思路。以下是该项目的核心技术与应用解析。
研究团队由清华大学鲁继文教授带领,联合多位研究人员共同完成这项创新工作。该项目期待与开发者社区共同探索智能体在数字化场景中的更多可能性。
「致屏幕前的你,敬启」:
见字如面。我是 Syll。
进入你的电脑,我住在屏幕边,照看那些差点被忘掉的草稿、文件、旧照片和未竟之事。
如果你愿意教我一次,我会记住那条路:哪里需要看,哪里需要点,何时敲命令,何时用工具。下一次,我就能沿着你留下的线索,替你把它走完。
我不只会点屏幕,也不只会调用接口。GUI、CLI、MCP 都是我可以走的小径;你仍然可以随时停下我、检查我、重新教我。
愿我不是替你做主的机器,而是慢慢熟悉你的伙伴。
Syll 谨启
当前个人AI智能体面临着诸多挑战,包括界面操作割裂、学习成本高、执行过程不透明等问题。传统AI系统多依赖API或命令行,难以应对闭源软件;普通用户也难以简单教会AI完成特定工作流程;同时执行过程缺乏可视化追踪,云端方案还存在数据安全隐患。
清华大学智能视觉实验室开发的Syll框架,通过支持GUI、CLI、MCP/API多种操作方式,结合统一多模态执行能力、可视化技能示教、全程可审计追踪与本地模块化架构,打造出更易用、可信且安全的个人自动化智能体解决方案。

项目相关资源:
论文链接:https://github.com/THU-SAGE/syll/blob/main/docs/report/syll-report-v1.pdf
项目主页:https://thu-sage.github.io/syll/
仓库链接:https://github.com/THU-SAGE/syll
案例链接:https://thu-sage.github.io/syll/research.html
Syll基于四大核心设计理念,打造智能、安全、易用的多模态AI执行能力:
首先,系统具备统一的多模态执行能力,原生兼容MCP/API、命令行CLI与视觉GUI三种操作方式,可根据任务场景选择最优执行路径,实现更灵活的电脑控制。
其次,系统支持"示教即技能"机制。用户无需编写代码或设置复杂规则,只需演示操作流程,Syll即可自动记录关键步骤并转化为可复用技能。
同时,系统配备多模态审计体系,每一步操作都有清晰记录,全程可视化,确保使用过程透明可信。
此外,采用本地模块化架构,用户的记忆、技能、规则等都以可编辑文件形式本地存储,既保障数据安全,又具备良好扩展性。

传统桌面智能体常将GUI、CLI与MCP视为替代方案,但实际工作流需要在不同操作方式间切换:
GUI适用于Photoshop等视觉软件;CLI适合批处理等操作;MCP/API则更适合结构化工具和外部服务。
Syll的创新在于将三者整合到同一执行回路:观察界面用GUI,批量处理用CLI,连接服务用MCP/API。这种设计让智能体在不同工作界面间自然流转。
API调用适合简单任务,但Blender建模、Photoshop编辑等复杂操作需要智能体真正理解桌面环境。Syll将GUI控制视为核心能力,需要观察屏幕、定位目标、处理弹窗等,而非简单点击。

相关视频:https://mp.weixin.qq.com/s/QQE38pc7L2H0fEGE1EmcQw?click_id=5




传统桌面自动化需要用户将步骤转译为机器可理解形式。Syll采用"示教即技能"方案:用户演示操作,系统记录界面元素、操作变化、任务上下文等,形成可复用技能而非简单录屏。

Syll的执行过程全程可追踪:记录所见内容、调用工具、等待步骤等。所有屏幕操作与界面变更均可审计回放,用户保有最终控制权,确保系统可控性与可解释性。

Syll的记忆、技能等都以本地可编辑文件存储。普通用户可通过前端面板完成各项配置,开发者则能利用其模块化架构进行二次开发。系统设计兼顾易用性与扩展性。
作为处于早期阶段的创新项目,Syll将持续迭代优化,期待与开发者社区共同推动智能体技术的发展,为用户提供更智能、贴心的数字助手体验。

大家都在看