GitHub周趋势2026W25 | Headroom 压缩 95% Token、NVIDIA 开源 AI Agent 安全扫描器、…
2026-07-28
2026-07-28 0
在大模型发展初期,我就开始用rust搭建llm服务,当时的想法很纯粹,借助Rust实现高性能的大模型中间服务。并且在自娱自乐中怡然自得。因为没有对比,也就无从感知性能到底是强是弱。再加上sse的交互方式,是真的无感。

初入大模型开发,首先满足的是自己的技术欲,当时candle框架刚开源不久,师出hugging face,拿来做了第一手的实战体验,因为里边有各种demo,运行下来便算是机器学习入门了。而后感觉对机器学习很多概念不了解,又去找了几本书学习,当然书里面的都是基于python体系的。学习了之后一度想自己训练几个模型,后来发现很烧显卡,单凭自己的这台小Mac难堪重任。再加上LLM日渐日益昌盛,资本也好,技术也罢,都在扎堆的向大模型看齐。于是不了了之了。而我也没有想改变自己的初衷,用rust构建高性能LLM服务,不做LLM的底层,只做上层应用。
后来,阿里的通义千问开源,我基于LLmaEdge在本地搭建了个本地大模型,同样也没有选基于Python的任何框架,我的目标是在工作中不能完全摆脱写Python代码,我的技术体系一定要把Python排斥在外,甚至All In Rust也在所不惜。只是本地搭建后来感觉也毫无意义,能运行,性能实在拉胯,再加上只能运行14B以内的小模型,让本不优秀的推理能力雪上加霜,就像过山车一样,最后只能回到垃圾箱。
借助Candle让我看到了Rust在机器学习领域的潜力,又关注了Qdrant这个向量数据库也是Rust技术栈,在本地搭了体验后,感觉可以用到利用向量文本查重,于是没多久我就用candle部署了bge-m3,跑了向量,用于相似度查询,效果惊人。没多久把这个搬到了线上。自己部署的时候使用了L2归一,最近想切公共API发现,厂商提供的接口只给返回生成后的向量,没有额外参数,获取不到当前版本归一运算的其它参数,直接不兼容。如果重新跑数据,几千万数据估计要跑两个月了。
如果说之前都是小打小闹,DeepSeek的横空出世成为了AI落地业务的催化剂,年还没过完就开始加班搞大模型落地,初期只是把AI入口暴露到了前段页面,底层使用DS和豆包的能力,融各家之所长,让我们用户体验了把大模型的基本应用。然后是各种数据报表AI化,快速的把报表类的AI化。此类应用用户量不是太大,安安稳稳度过了几个月。
后续又就大模型的结构化能力做了一些重业务的应用,比如将word解析后的内容直接格式化后入库、截屏内容给大模型让其推理我们想要的结构化数据、扔给大模型一部分用户的历史数据让其生成专业化的记录。
我一直以为我可以借助Tokio大法就这么一直迭代下去,百万请求不在话下,直到最近遇到IO和CPU混合型的AI处理,上线后大量用户反馈超时,第一次被RUST背刺,开始觉得Rust也不像其标榜的那样,零抽象高性能,或许是对Tokio的理解不够深入吧,经过反复测试,最终得出一个结论,Tokio擅长的是IO类的调度。任务处理速度越快,Tokio的优势越大。相反如果很慢,如果包含CPU密集的运算,Tokio的优势就会变成劣势,很快就会调度饱和然后开始阻塞用户请求,我专门去官方的讨论区和贡献者杠了差不多一个星期,一言难尽,从一开始双方对话本不就在一个频道。我说的是高并发下会阻塞,对方一直强调他们的没问题。对方建议我把功能减到最小,我感觉是在嘲讽我,但是没办法,真实业务就是如此,必须要处理。我开始花很大的精力去寻找解决方案。
几经测试和反复试验,最终选择了Rayon Tokio 的组合方案,将CPU密集任务统一转到了Rayon来处理,Tokio自带的阻塞线程池此时就有点特别鸡肋,扔的多了Tokio自己就阻塞了。我问了下AI,AI告诉我这个组合=极致性能,实际测试,还得依赖更好的CPU和内存,如果CPU不行还是那么拉胯,所以功夫再高也怕菜刀,对于这种混合型AI业务来说,高并发就是那把刀,还是刀刀见血,刀刀往你系统瓶颈上砍,动辄上千并发时候,CPU跟不上,管你是Rust还是GO或者Java,服务秒歇菜。
现在距离真正的AIGC还差的很远,当有一天AI落地的业务应用数量足够多,能够形成一个系统,那就是真正的AIGC了。而这个系统对第三方流水线或者客户端依赖越少越好,不然呢?如果发展到和操作系统能媲美的AI系统还依赖一堆dify coze n8n,那维护起来都是灾难。我觉得AI系统落地,框架不重要,技术也不重要,开发语言只是实现业务落地的一个工具仅此而已,技术选型完全是作为一个开发者的个人喜好的自嗨,毕竟AI时代,哪还有什么门槛。基础原理都一样,一通则百通。重要的是AI落地的业务,用户认可,愿意付费,这才是核心。
我非常期待第一款由AI完全驱动的业务级应用系统会诞生在哪家公司,会是DeepSeek家吗?想想以后你每天的工作任务就是给AI系统下达指令,比如完成什么功能的业务代码开发,完成某项代码的验收,在几点几点部署上线,亦或是让AI给你搜集材料制作PPT、报告,为你编写课件、汇总你的学生数据因材施教,给你规划最合理的教学方式,而你只需要闲暇时看看AI系统执行进度如何?把大量的时间留给思考或者交流上,而不是敲键盘,是不是也挺AI?
本文参与腾讯云自媒体同步曝光计划,分享自微信公众号。原始发表:2025-07-29,如有侵权请联系[email protected] 删除