Lab
我一直保留自己的技术实验环境,也持续搭建一些真正长期使用的系统。
这些实践一方面解决自己的实际问题,另一方面也用来判断一项新技术从「可以演示」到「可以长期工作」之间究竟还差什么。
最近几年,主要集中在三个互相关联的方向:
模型与基础设施 → Agent 工作系统 → 真实知识工作。
AI 系统
我长期运行本地和云端的大模型环境,并持续调整硬件、模型和推理框架的组合。
实际使用和测试过多卡 RTX 4090、3090、Mac M3 Ultra 以及部分 AMD GPU 平台。
关注的是一套系统真正长期运行以后,质量、速度、成本、显存和可控性怎样取得平衡。
具体会持续测试量化方式、Dense / MoE、TTFT、Prefill、生成速度、并发、长上下文、KV Cache,以及 SGLang、vLLM 等推理框架。
也会比较本地模型与云端模型在不同任务中的边界:
什么时候本地已经足够,什么时候云端能力值得额外成本,以及两者怎样组合才能形成稳定的工作环境。
Benchmark 提供初筛;最终保留哪些模型、硬件和配置,取决于它们在真实工作流中的长期表现。
Agent 系统
我长期使用 Coding Agent 和多 Agent 处理真实的长任务。
任务变长以后,模型能力只是其中一部分,决定 Agent 能不能长期工作的,越来越是一个完整的软件系统问题:
任务怎样拆分,主 Agent 和 Sub-agent 怎样协作,权限如何限制,状态怎样保留,上下文怎样延续,失败以后怎样恢复,以及结果如何检查。
因此我持续实践和调整:
主 Agent / Sub-agent 分工、Agent 间通信、Sandbox、权限边界、Context Compression、Handoff、Memory、RAG、工作目录隔离和自动验证。
目标是让由人和 Agent 共同组成的工作系统,在长任务和复杂任务中保持可控、可验证和可恢复。
企业与金融研究系统
我也在搭建持续运行的企业与金融研究系统,连接企业资料、财务数据、宏观信息和事件流。 主要用于阅读财报、比较公司、研究商业模式、跟踪事件、维护假设和核查事实。
企业与金融研究也是前面两套系统的实际使用场景。
AI 可以很快扩大信息覆盖范围,但信息增加并不自动产生更好的判断,所以系统会有意识地区分低成本的信息筛选、可验证的事实核查,以及值得投入更多计算和人工判断的深入分析。
同时尽量保留:
信息从哪里来、哪些是事实、哪些是假设、为什么形成当前判断,以及什么新事实应该使这个判断发生变化。
其他实验
Decision Lab
这是一些围绕工作、财富、教育、城市选择、时间价值和自由度进行的长期决策模型实验。
通常会把一个原本很模糊的问题逐渐拆成明确变量、边界条件、可验证假设、敏感性区间和不确定性,并让模型能够随着新事实继续更新。
其中一部分正在变成问卷和简单的 AI 辅助分析工具。