作者:Lingo 发布: 阅读时间:66 分钟

别再从转述里理解 AI 与创业:100 个一线信息源

互联网上的大量技术和创业内容来自转述。模型发布被压缩成参数比较,工程事故被改写成几条经验,创业公司的经营过程最后只剩融资数字。读者看到结论时,原始条件、失败样本和当事人的利益位置往往已经消失。

判断一项技术能不能进入产品,最好回到正在承担结果的人。写代码的人会留下提交和 issue,研究者会持续发表论文,做产品的人会谈到客户拒绝了什么。创始人也会宣传自己的公司,但这些原始记录至少允许读者检查上下文,再决定一句话能否用于自己的项目。

中文技术圈的一手材料有自己的形态。研究进展常出现在 Google Scholar,开源维护者把取舍写进代码和讨论区,独立开发者则会在博客里复盘产品。英文技术圈的动态更多集中在 X,重要判断仍要沿着帖子找到论文、代码或产品文档。

“一线”是什么意思

一线不是职位高,也不是粉丝多。一个人即使曾经做出重要项目,多年没有新的论文、代码或产品记录,也很难帮助读者理解今天的问题。相反,持续处理具体故障、发布研究结果或回应用户的人,即使名气不大,留下的信息通常更有用。

关注一位创始人或研究者,也不等于接受他的全部判断。产品发布会选择有利数据,论文结论也受实验条件限制。遇到会影响投入的说法,继续查看原始材料,并确认发布时间和适用范围。

中文互联网的一线足迹

点开姓名,可以直接看到他们最近发表的论文、提交的代码或公开讨论。遇到与自己项目相近的问题,可以继续追踪后续更新,也可以在开放的评论区和 issue 中追问。

模型、数据与 AI 系统

人物与关注入口现在在做什么从这里能看到什么
李沐 · 哔哩哔哩持续公开深度学习课程和论文讲解论文如何还原成代码,实验条件怎样改变结论
苏剑林 · 科学空间持续研究语言模型、生成模型和数学方法损失函数、长文本、推理方法及完整推导过程
陈天奇 · GitHub在 CMU、NVIDIA 继续推进机器学习系统,维护 TVM 相关项目编译器、端侧推理和模型系统如何适配硬件
邱锡鹏 · Google Scholar领导 OpenMOSS 团队研究大模型和智能体新模型架构、后训练、智能体评测和具身研究
刘知远 · Google Scholar研究自然语言处理与基础模型,参与端侧模型建设模型知识、压缩、评测和中文 NLP 的最新论文
姚顺雨 · Google Scholar研究能够使用工具和计算机的 Agent长程任务、工具交互和 Agent 评测怎样设计
何聪辉 · Google Scholar领导 OpenDataLab,建设 MinerU 和文档评测体系文档解析、训练数据基础设施和评测标准
荣钰 · Google Scholar研究科学智能、医疗模型和复杂结构数据AI for Science 如何建立数据和验证方法
俞涛 · Google Scholar负责逐际动力人形机器人基座模型全身控制、强化学习和人形机器人训练
葛艺潇 · Google Scholar负责小鹏机器人的具身智能和数据工作多模态模型、世界模型和机器人数据体系

开源软件与基础设施

人物与关注入口现在在做什么从这里能看到什么
尤雨溪Vue、Vite 创建者开源框架设计、兼容性、社区治理和长期维护
Anthony FuVue、Vite、Nuxt 生态的全职开源开发者工具链设计、开发体验和持续开源协作
sxzzVue、Vite 与 Rolldown 生态的核心贡献者编译工具链、插件兼容和大型项目迁移
张汉东Rust 中文社区长期建设者与工程实践者Rust 工程、语言生态和系统软件开发
吴晟Apache SkyWalking 创建者可观测性、分布式追踪和全球开源社区协作
温铭Apache APISIX 发起者、API7 联合创始人API 网关、开源商业化和基础软件交付
姜宁Apache 软件基金会成员,长期参与多个开源项目开源治理、分布式系统和社区协作
张磊OAM、KubeVela 等云原生项目发起者应用交付、云原生抽象和平台工程
黄东旭PingCAP 联合创始人,持续参与 TiDB 与 AI 数据系统分布式数据库、Agent 数据层和工程组织
周正中PostgreSQL 社区实践者,持续公开数据库案例数据库性能、真实业务负载和故障处理
张炎泼Databend、OpenRaft 等项目的系统工程师Raft、一致性协议和 Rust 分布式系统
XuanwoApache OpenDAL 发起者,参与 LanceDB 等数据系统存储抽象、Rust 工程和 AI 数据基础设施
鸟窝rpcx 作者,持续开发 Go 网络与 AI 编程工具Go 并发、网络协议和生产故障怎样落到代码
高策TensorChord 创始人,建设 VectorChord 等项目PostgreSQL、向量检索和 AI 数据系统创业
PhodalAutoDev、Shire 等 AI 编程项目的作者Coding Agent、遗留系统改造和工程验证

产品、独立开发与持续交付

人物与关注入口现在在做什么从这里能看到什么
冯若航持续开发 Pigsty,并公开 PostgreSQL 交付实践数据库成本、生产运维和开源产品化
DIYgod维护 RSSHub,参与 Folo、xLog 等产品大型开源项目的维护成本和信息产品设计
Tw93开发 Pake、MiaoYan,也持续做硬件和 Agent 实验小团队如何把原型做成日常可用的工具
Innei开发 Mix Space、Shiro 和 AI Agent 产品全栈产品、界面工程和自主系统的迭代过程
pseudoyu创办 Web3Insight,持续维护开源与独立产品AI 工作流、产品开发和基础设施的真实取舍
王巍维护 Kingfisher,开发 sim-use 等移动开发工具Swift、端侧 AI 和 Coding Agent 怎样进入移动工程
张鑫旭持续研究浏览器新特性并维护前端工具CSS、HTML 和无障碍能力的浏览器实测
戴铭持续开发 iOS 工具与应用,公开 AI 辅助开发实验iOS 性能、工具链和端侧产品开发
Randy独立开发 EpubKit、Notepal、Browserfly一个人怎样开发、销售和维护软件产品
Sukka持续研究 Web 性能、DNS 和 CDN 基础设施网络协议、站点性能和基础设施配置
Livid运营 V2EX,持续发布 AI Chat 与 Persona 的开发记录社区产品、付费机制和线上系统迭代
EGOIST · GitHub开发 ChatWise 等独立软件AI 客户端、桌面应用和个人产品商业化

机器人与物理世界 AI

人物与关注入口现在在做什么从这里能看到什么
彭志辉 · 哔哩哔哩智元机器人联合创始人兼 CTO,持续公开机器人项目机械结构、控制系统和机器人产品如何迭代
詹锟 · Google Scholar负责理想汽车基座模型与自动驾驶工作VLA、车端推理、世界模型和量产部署
刘绍淮 · GitHub研究模型式强化学习和人形机器人控制在线学习、仿真验证和控制算法的代码实现

英文互联网的一线足迹

生产级 Agent:从演示走到真实系统

Agent 领域最容易出现演示偏差。一个流程能在五次预设对话中成功,并不说明它能处理生产环境里的权限边界,也没有证明工具故障后可以恢复。成本一旦超过上限,或者脏数据进入链路,演示中的成功率就失去了意义。Harrison Chase 等人的公开工作记录了团队怎样处理这些问题。

人物(X)当前身份或工作适合观察的问题其他入口
Harrison ChaseLangChain 联合创始人LangGraph、Agent 运行时、可观测性,以及框架如何服务企业部署LangChain
Jerry LiuLlamaIndex 联合创始人企业知识库、RAG、文档工作流与数据接入LlamaIndex
Hamel Husain持续公开 AI 工程实践评测集怎样建立,错误分析如何反过来改变产品个人博客
Shreya Shankar研究 LLM 数据处理和评测LLM 数据处理、评测工作流和复杂文档任务个人研究主页
Jason LiuInstructor 作者结构化输出、数据抽取、验证失败和 AI 咨询交付Instructor 文档
Eugene Yan持续公开应用机器学习实践推荐系统、LLM 产品实验,以及线上指标怎样约束模型选择个人博客
Chip Huyen研究生产机器学习和 AI 系统推理基础设施、生产机器学习和 AI 产品工程个人主页
Simon WillisonDatasette 创建者,持续进行模型实验新模型的真实能力、工具调用、安全问题和可重复实验个人博客
Ankur GoyalBraintrust 创始人Prompt 版本、生产 trace、回归评测和开发工具的产品化Braintrust
Omar KhattabDSPy 创造者怎样把提示词试错改造成可优化、可评测的程序DSPy
Dex HorthyHumanLayer 创始人Coding Agent 的上下文工程、人工介入和复杂功能交付HumanLayer
Flo CrivelloLindy 创始人面向业务用户的 Agent 怎样定价、收敛场景并承担执行责任Lindy

如果团队正在做企业知识助手,优先看 Hamel Husain、Shreya Shankar、Jason Liu 和 Ankur Goyal。他们提供的价值不在于再介绍一个框架,而在于展示开发者怎样构造测试集、发现失败类型,再决定是否允许系统进入生产环境。

模型与推理基础设施:判断能力边界

应用团队不必每天追逐模型榜单,但需要知道底层能力为什么变化。模型架构、推理效率和开源工具会直接改变部署成本,也会改变一个小团队能够承担的产品范围。

人物(X)当前身份或工作适合观察的问题其他入口
Andrej Karpathy研究者、教育者,持续发布模型教学项目从训练代码理解模型,而不是只记住产品名称个人主页
Georgi Gerganovllama.cpp 创建者端侧推理、量化、硬件适配和开源性能优化llama.cpp
Tri DaoFlashAttention 核心作者注意力计算、内存效率和模型架构的工程约束FlashAttention
Thomas WolfHugging Face 联合创始人开源模型生态、研究发布和模型分发方式Hugging Face
Jeremy Howardfast.ai 与 Answer.AI 创始人小团队怎样把研究成果变成可使用的工具fast.aiAnswer.AI
Soumith ChintalaPyTorch 联合创造者训练基础设施、框架演进和研究工程文化PyTorch

这组账号更适合校正技术判断,不适合直接决定商业主线。一个新架构降低了推理成本,只能证明某些方案变得可行;客户是否愿意付费,还要回到具体工作流和替代成本。

经营一家技术公司:客户、定价和组织约束

技术创业的信息差经常不在模型,而在交易过程。谁拥有预算,客户为什么续费,低价项目为何拖垮交付,这些问题很少出现在融资新闻里。沿着经营者留下的产品和长期复盘,更容易看到一家公司怎样面对这些约束。

人物(X)当前身份或工作适合观察的问题其他入口
Jason CohenSmart Bear、WP Engine 创始人市场规模、定位、增长上限和创始人取舍长期文章
Rob Walling多次 SaaS 创业,创办 TinySeed 和 MicroConf小型 B2B 软件怎样找到第一批客户并建立可重复销售TinySeedMicroConf
David CramerSentry 联合创始人兼 CTO开源 SaaS、开发者产品、工程质量和 AI 编程落地Sentry
Arvid KahlFeedbackPanda 创始人窄市场、客户访谈和自筹资金公司的增长边界The Bootstrapped Founder
Pieter Levels独立开发者,创建 Nomad List、Remote OK 等产品独立开发者怎样快速发布并直接收费;他的个人化技术方案不必照搬产品主页
Des TraynorIntercom 联合创始人AI 客服、产品战略和成熟 SaaS 面对 Agent 冲击时的选择Intercom
Jason Fried37signals 联合创始人小团队经营、范围控制和长期盈利37signals
David Heinemeier HanssonRuby on Rails 创造者、37signals 联合创始人创始人亲自参与工程、云成本和组织设计的利弊Ruby on Rails37signals
Tobi LütkeShopify 联合创始人兼 CEO技术创始人怎样管理平台型产品和大型工程组织Shopify
Guillermo RauchVercel 创始人开发者产品、前端基础设施和 AI 应用分发Vercel
Amjad MasadReplit 创始人AI 编程产品如何从工具走向用户可完成的任务Replit
Mitchell HashimotoHashiCorp 联合创始人、Ghostty 作者开源项目、开发者工具和创始人回到一线工程后的工作方式Ghostty

这组人的主张彼此并不一致。Jason Fried 倾向于控制组织规模,Tobi Lütke 管理的是大型平台,Pieter Levels 则依靠极小团队和个人执行。他们提供的是不同约束下的案例。读者应先确认自己的客户、资本和团队条件,再判断哪段经验可以外推。

从模型展示到业务结果

上一节讨论客户、定价和交付;模型产品也要经过同一个检验。视频生成最终要交付能发布、能修改的成片,时序预测最终要改变排班或库存。把公开演示和产品更新放在一起看,才能判断模型有没有进入真实工作流。

人物(X)当前身份或工作适合观察的问题其他入口
Cristóbal ValenzuelaRunway 联合创始人兼 CEO生成模型怎样进入专业创作流程,研究能力如何变成商业产品Runway
Alex MashrabovHiggsfield 联合创始人兼 CEO视频生成的产品形态、创作者分发和商业化速度Higgsfield
Max MergenthalerNixtla 创始人开源时序预测、基础模型和企业数据场景Nixtla

观察这类产品时,清晰度和生成时长只是起点。还要看素材权属、人物一致性、修改次数、预测基线、回测方式和最终决策成本。只有这些条件能够对上,模型指标才可能转换成报价与验收条件。

机器人与物理世界 AI:演示之外的可靠性

物理世界会放大错误成本。机器人在视频里完成一次任务,不代表它能适应不同光照、物体和操作人员。这个领域的一手信息应尽量回到论文、数据集、现场实验和硬件约束。

人物(X)当前身份或工作适合观察的问题其他入口
Chelsea FinnPhysical Intelligence 联合创始人、机器人学习研究者机器人基础模型、数据规模和泛化能力Physical Intelligence
Jim FanNVIDIA 机器人研究负责人仿真、具身智能和通用机器人的研究进展Google Scholar
Pieter AbbeelUC Berkeley 教授、Covariant 联合创始人强化学习、机器人操作和研究成果商业化Google Scholar
Sergey LevineUC Berkeley 教授、Physical Intelligence 联合创始人机器人学习、真实数据采集和大规模策略训练Google Scholar
Ted XiaoProject Prometheus 创始技术成员,研究物理世界模型能理解并作用于物理世界的前沿模型个人研究主页

研究团队发布的新能力可以帮助判断长期方向,却不能直接证明客户已经准备采购。面向工业客户时,仍要继续追问设备接口、停机风险、责任边界和现场维护成本。

AI 计算硬件:理解算力为什么贵

应用创业者通常不需要设计芯片,但需要理解算力价格背后的系统约束。训练和推理成本并不只由 GPU 型号决定,内存、互连、编译器和工作负载都会改变最终经济性。

人物(X)当前身份或工作适合观察的问题其他入口
Jim KellerTenstorrent CEO、芯片架构师AI 芯片架构、硬件团队和开放计算生态Tenstorrent
Andrew FeldmanCerebras 联合创始人兼 CEO晶圆级计算、训练系统和硬件公司怎样进入客户采购Cerebras

不能绕开的 20 个 AI 创业信号源

模型价格一变,产品毛利会跟着变。平台调整分发规则,原有的获客路径也可能失效。新的评测结果,则可能推翻团队刚做完的技术选择。

这些人和组织就在改变上述条件,也持续发布产品变更、研究结果和可复查数据。这些信号源的立场经常互相冲突,甚至会夸大自身路线。持续关注不是为了选边站,而是为了尽早发现创业环境已经变了。

人物或组织(X)当前工作为什么不能忽视其他入口
Sam AltmanOpenAI 联合创始人兼 CEOOpenAI 的模型发布、价格和产品方向会迅速改变应用公司的能力边界OpenAI News
Dario AmodeiAnthropic 联合创始人兼 CEO他持续讨论模型扩展、安全边界和企业采用,这些判断直接影响 Claude 的路线个人文章
Demis HassabisGoogle DeepMind 联合创始人兼 CEOGoogle 怎样把基础研究接入搜索、科学计算和消费产品,常能从他的公开动态提前看到Google DeepMind Blog
Elon MuskxAI 创始人xAI 同时调动算力、X 的分发和消费产品入口,执行速度会影响整个市场的竞争节奏xAI News
Fei-Fei LiWorld Labs 联合创始人、Stanford 教授她把空间智能从研究问题推进到产品,提供了语言模型之外的一条创业路径World Labs Blog
Aravind SrinivasPerplexity 联合创始人兼 CEOAI 搜索如何获取用户、处理内容来源并建立商业模式,可以沿着他的产品决策观察Perplexity Blog
Bret TaylorSierra 联合创始人他直接推动企业 Agent 进入客服流程,适合观察大型客户如何购买和部署 AISierra
Andrew NgDeepLearning.AI、AI Fund 创始人他长期从应用和人才训练出发判断机会,能帮助学习者把模型能力转成可执行项目DeepLearning.AI 课程
François CholletARC-AGI 创建者,持续研究智能评测他的工作不断追问模型究竟学会了什么,能校正只看演示和榜单的判断方式ARC Prize Blog
Clement DelangueHugging Face 联合创始人兼 CEO开放模型怎样分发、建立社区并形成商业平台,可以从他的决策中持续观察Hugging Face Blog
George Hotztinygrad 创始人他用小型团队直接挑战训练框架和算力软件栈,许多判断尖锐,但代码可以立即验证tinygrad
Mistral AI开发开放权重模型和企业 AI 产品它代表美国大型实验室之外的重要模型路线,也持续影响欧洲的部署与监管选择Mistral News
Cohere面向企业开发语言模型和检索系统它更关注私有数据、权限和企业交付,能补足消费级模型发布没有覆盖的问题Cohere Research
Epoch AI研究模型能力、算力和训练趋势训练规模与能力增长的讨论容易被口号带偏,Epoch 提供可检查的数据和方法研究与数据
METR评估前沿模型完成长程任务的能力与风险Agent 是否能独立完成真实工作,需要任务级实验,而不只是模型厂商的演示METR Blog
Artificial Analysis独立测试模型质量、速度和价格创业团队可以用它比较真实延迟和调用成本,避免只依据厂商公布的单项成绩模型对比
Arena.ai维护大模型盲测和人类偏好评估它让读者看到用户实际偏好怎样变化,也暴露公开评测容易受到的偏差Arena
MLCommons建立机器学习训练、推理和安全基准芯片与系统供应商采用共同测试后,性能和成本比较才有更可靠的参照系MLCommons Benchmarks
OpenRouter提供多模型 API 路由和用量市场它汇集模型可用性、价格和实际使用变化,能帮助产品团队判断市场正在选择什么模型排行
EleutherAI开放研究社区,发布模型、数据集和训练工具它展示了非大型公司团队怎样组织开放研究,许多训练方法和数据实践可以直接复现GitHub

把 100 个信号源变成一套可维护的信息系统

一次性订阅所有动态会让高价值内容重新被信息流淹没。可以按正在解决的问题建立四个收藏组:

  • AI 系统:Agent、评测、模型和数据基础设施;
  • 开源工程:数据库、云原生、编程语言和开发者工具;
  • 技术经营:客户发现、定价、交付和公司组织;
  • 物理世界:视频、时序、机器人、自动驾驶和芯片。

每周不必整理全部帖子。只保存四类内容:本人完成的实验,自己公司的经营数字,真实客户部署复盘,以及带代码或数据的失败分析。保存时同时记录原始链接、发布日期和适用条件。以后若要引用,先检查项目是否已经更新,数字是否来自同一个统计口径。

还可以为重要账号设置一个简单的验证路径:

本人动态 / 个人博客 / 项目更新
  ↓ 找原始链接
代码仓库 / 论文 / 产品文档 / 经营复盘
  ↓ 检查样本、时间、基线和利益关系
可用于当前决策的事实
  ↓ 写明适用条件
技术选型、产品实验或客户访谈问题

一手信息的价值不在于它必然正确。它减少了一层转述,让读者能够看到原作者使用了什么数据、承担什么角色,又遗漏了哪些条件。对创业者而言,这种可追溯性比获得更多行业观点重要。观点可以继续更新,已经投入的时间和资金却很难撤回。