AI 系统

我长期运行本地和云端的大模型环境,并持续调整硬件、模型和推理框架的组合。

实际使用和测试过多卡 RTX 4090、3090、Mac M3 Ultra 以及部分 AMD GPU 平台。

关注的是一套系统真正长期运行以后,质量、速度、成本、显存和可控性怎样取得平衡。

具体会持续测试量化方式、Dense / MoE、TTFT、Prefill、生成速度、并发、长上下文、KV Cache,以及 SGLang、vLLM 等推理框架。

也会比较本地模型与云端模型在不同任务中的边界:

什么时候本地已经足够,什么时候云端能力值得额外成本,以及两者怎样组合才能形成稳定的工作环境。

Benchmark 提供初筛;最终保留哪些模型、硬件和配置,取决于它们在真实工作流中的长期表现。

Agent 系统

我长期使用 Coding Agent 和多 Agent 处理真实的长任务。

任务变长以后,模型能力只是其中一部分,决定 Agent 能不能长期工作的,越来越是一个完整的软件系统问题:

任务怎样拆分,主 Agent 和 Sub-agent 怎样协作,权限如何限制,状态怎样保留,上下文怎样延续,失败以后怎样恢复,以及结果如何检查。

因此我持续实践和调整:

主 Agent / Sub-agent 分工、Agent 间通信、Sandbox、权限边界、Context Compression、Handoff、Memory、RAG、工作目录隔离和自动验证。

目标是让由人和 Agent 共同组成的工作系统,在长任务和复杂任务中保持可控、可验证和可恢复。

企业与金融研究系统

我也在搭建持续运行的企业与金融研究系统,连接企业资料、财务数据、宏观信息和事件流。 主要用于阅读财报、比较公司、研究商业模式、跟踪事件、维护假设和核查事实。

企业与金融研究也是前面两套系统的实际使用场景。

AI 可以很快扩大信息覆盖范围,但信息增加并不自动产生更好的判断,所以系统会有意识地区分低成本的信息筛选、可验证的事实核查,以及值得投入更多计算和人工判断的深入分析。

同时尽量保留:

信息从哪里来、哪些是事实、哪些是假设、为什么形成当前判断,以及什么新事实应该使这个判断发生变化。

其他实验

Decision Lab

这是一些围绕工作、财富、教育、城市选择、时间价值和自由度进行的长期决策模型实验。

通常会把一个原本很模糊的问题逐渐拆成明确变量、边界条件、可验证假设、敏感性区间和不确定性,并让模型能够随着新事实继续更新。

其中一部分正在变成问卷和简单的 AI 辅助分析工具。