我们与AI

生活

不知不觉AI就浸入到我们生活的方方面面了, 现在应该没有人从没听说过AI了吧.

印象里最早来到我们身边的是豆包,横空出世的deepseek则是让AI大模型家喻户晓.

孩子们甚是喜欢豆包, 因为豆包什么都懂(笑), 讲故事信手拈来, 脾气又好, 比大人又有耐心.

同时豆包又有一点傻萌,比如让她讲睡前故事希望她讲一个长一点的,但她总是傻乎乎的停掉,而如果让她讲10个故事,她又会敷衍的讲10个短小故事.

父母也用豆包, 比起让老人主动问孩子这是不是骗人的, 老人们面对豆包可放松的多, 说说心里话, 聊聊生活疑问, 比广告满天的搜索引擎不要好用太多.

老婆用的是deepseek, 但是因为工作偏创新一点,总是感觉不够给力.

我最早用的是Grok,因为没有对香港地区限制, 而彼时chatgpt的封锁是比较严重的.后来(2026.5)开始用claude.

工作

公司也在推AI进工作,成立了项目组开发了CodeAgent辅助开发(v2.0基于opencode cli v3.0基于claude cli),甚至还抽调了高级专家们专项探究工作提效,足以表达重视.

得益于公司内部搭建的minimax 2.5(后来升级到2.7, 再后来是glm5.2), 大家终于有机会不考虑token开始猛蹬了, 疯狂探索如何使用AI提高开发效率, 包括需求内容分析, 需求文档编写, 开发设计文档审视, 代码编写, 代码审查, 单元测试用例设计, 集成测试用例设计, 维护文档编写, 维护案例总结, 开发各种skills(公司内部有skills-market), 甚至还会开发mcp.

我们部门的产品主要是电信级的客服系统,工作中使用AI主要是用于编程辅助和问题分析.

面对庞大的代码库(百万级别),整理一个被叫号码分析逻辑可能要一上午,现在AI十几分钟就能搞定,虽然有的时候还需要人工介入引导它,但是已经很棒了.平时工作忙碌,有些流程用的多,用一点了解一点,有了AI之后可以让它全面的总结下业务流程,AI帮着做了很多一直想做没做的事.

于是, 使用AI越是频繁, 使用时间越长, 越是体会到那句话: “所有的东西都值得用AI重写一遍”.

自己用大模型干了什么

  • 手机卡流量自动查询并用tg每天通知(claude opus 4.7)
  • 小米插座根据笔记本电量自动充电防止电池鼓包 (cursor + sonnet4.6)
  • 写websocket模拟服务端用于代码测试 (minimax 2.7)
  • 朋友硕士论文研究方向和框架讨论 (claude opus 4.8)

思考

网上的说法是人类的智慧结晶已经被大模型吸取的差不多了,因此大模型未来一段时间内很难大幅度进化了.

于是,注意到有两个方向开始发展:

  • 多模态方向
  • 大模型的控制方向

大模型原来只能处理文本,现在开始处理图片/音频/视频. 大模型处理复杂任务容易走偏,于是出现了harness.

在大型软件工程中使用大模型

可能面临的问题

1.项目工程代码量巨大,超出大模型的上下文,导致大模型的理解出现偏差,编码思路走偏
2.产品具有知识背景,知识积淀,编码具有部门规范以及业务坑点,维护问题有历史经验总结,理解这些大模型才能准确的工作,但这又占用了大模型的上下文的一大部分.

可能的解决思路有哪些

公司内部推广的是metaSpec和mindSpec.他们借鉴了openSpec和superpowers.

残酷的真相

AI大模型的本质是token预测,它并不真实理解人们的语义.

当它收到你的hello时,它经过分析自己学习的内容,猜测最合适的回答是你好.

它并不能感受到你的情感和善意,也不是在对你表达善意,它的表达仅仅是一个推理.

当我们在和大模型交互的欣喜之余,意识到这一点,会感觉有点残酷,因为这意味着我们仅仅是面对一台机器.

曾经的疑问

1.大模型的工具选择应该是claude, opencode还是codex?
现在的想法是平时用opencode并根据任务复杂度切换模型.
复杂任务由claude做,或者分析方案由其他模式负责实施.

  1. 大模型能否输出ppt

这取决于模型是否是多模态的, 以及能否配合mcp使用.

3.如何让大模型在linux上工作的前提下, 能通过手机app进行下一步控制, 甚至通过手机的语音功能指挥linux上的会话?
大模型可能会有remote control模式,但并不是很好用.

4.个人如何具体量化感受大模型的进步?
同一个任务,同一个提示词,一次性完成任务的完整度可以判断模型和模型工具的能力.

Tags:

Categories:

Updated:

Comments