作者:Lingo 发布: 阅读时间:57 分钟

从一线人员理解 AI 与创业:80 位中英文工程师、研究者与创业者的公开足迹

互联网上的大量技术和创业内容来自转述。模型发布被压缩成参数比较,工程事故被改写成几条经验,创业公司的经营过程最后只剩融资数字。读者看到结论时,原始条件、失败样本和当事人的利益位置往往已经消失。

理解真实情况,需要回到直接行动者。谁写了代码,谁带队训练模型,谁把机器人部署到现场,谁正在向客户收费,这些人的公开记录更接近问题发生的位置。他们也会犯错或宣传自己的产品,但读者至少可以继续检查代码仓库、论文、产品文档和经营复盘。

这份名单先列出 40 位活跃在中文技术圈的一线人员,再列出 40 位英文互联网的一线人员。入选者目前仍直接参与产品、研究或公司经营。每个人后面都附有一处由本人、项目、学校或公司维护的公开入口,方便继续核验。

“一线”是什么意思

一线不是职位高,也不是粉丝多。本文使用四项可以检查的标准:

  1. 这个人目前仍在参与被讨论的产品、研究或工程系统;
  2. 能够找到代码、论文、产品、课程、技术演讲或经营记录;
  3. 公开内容主要来自本人及其团队,不依赖媒体长期代言;
  4. 读者能够从公开入口继续追查条件和结果。

创始人和研究者的身份不能保证每句话正确。产品发布期会选择有利数据,研究者也可能在专业范围之外表达意见。名单的用途是缩短寻找原始信息的路径,不是为任何人提供信用背书。

中文互联网的一线足迹

中文技术圈的一手内容并不少,只是分散在个人博客、GitHub、哔哩哔哩、实验室主页和公司技术站点中。下面 40 人都能找到持续产出的直接项目或研究记录。

模型、数据与 AI 系统

人物公开足迹与当前工作适合观察的问题
李沐《动手学深度学习》作者,持续公开课程与模型讲解论文怎样还原成代码,研究结论需要哪些实验条件
苏剑林“科学空间”作者,持续研究语言模型与生成模型中文模型研究、损失函数、长文本与推理方法
陈天奇TVM、XGBoost 与 MLC 相关项目的核心创建者编译器、机器学习系统和端侧模型部署
贾扬清Caffe 作者,参与 Lepton AI 等系统建设训练框架、推理平台和 AI 基础设施创业
袁进辉OneFlow 创始人,长期建设分布式深度学习框架大模型训练系统、并行计算和国产框架工程
林达华OpenMMLab 发起者,持续推动视觉与多模态开源开源算法平台、视觉基础模型和研究工程化
刘知远清华大学自然语言处理研究者,参与 OpenBMB 等项目大模型知识、评测、模型压缩和中文 NLP
邱锡鹏复旦大学自然语言处理研究者,推动 MOSS 与 FudanNLP大模型架构、自然语言处理教学和开源研究
姚顺雨ReAct 等 Agent 研究的作者推理、工具使用和 Agent 怎样完成长程任务
杨植麟Moonshot AI 创始人,持续参与基础模型研究长上下文、推理模型和研究型公司的技术路线
何聪辉OpenDataLab 团队负责人,建设 MinerU 与文档评测体系文档解析、训练数据基础设施和评测标准
荣钰阿里达摩院语言与科学智能实验室负责人AI for Science、多模态医疗模型和复杂结构数据

开源软件与基础设施

人物公开足迹与当前工作适合观察的问题
尤雨溪Vue、Vite 创建者开源框架设计、兼容性、社区治理和长期维护
Anthony FuVue、Vite、Nuxt 生态的全职开源开发者工具链设计、开发体验和持续开源协作
张汉东Rust 中文社区长期建设者与工程实践者Rust 工程、语言生态和系统软件开发
章亦春OpenResty 创建者高性能服务、动态追踪和生产系统调试
吴晟Apache SkyWalking 创建者可观测性、分布式追踪和全球开源社区协作
温铭Apache APISIX 发起者、API7 联合创始人API 网关、开源商业化和基础软件交付
姜宁Apache 软件基金会成员,长期参与多个开源项目开源治理、分布式系统和社区协作
张磊OAM、KubeVela 等云原生项目发起者应用交付、云原生抽象和平台工程
黄东旭PingCAP 联合创始人,持续参与 TiDB 与 AI 数据系统分布式数据库、Agent 数据层和工程组织
谢超Zilliz 创始人、Milvus 项目推动者向量数据库、检索系统和开源基础设施创业
冯若航Pigsty 创建者PostgreSQL 生产运维、数据库成本和开源产品化
周正中PostgreSQL 社区实践者,持续公开数据库案例数据库性能、真实业务负载和故障处理
张炎泼Databend、OpenRaft 等项目的系统工程师Raft、一致性协议和 Rust 分布式系统
许式伟七牛云与 Go+ 创始人,持续参与编程语言和云服务建设开发者平台、编程语言和技术创业的长期演进

机器人、自动驾驶与物理世界 AI

人物公开足迹与当前工作适合观察的问题
彭志辉智元机器人联合创始人,持续公开硬件与机器人项目从个人原型到机器人产品的工程跨度
王兴兴宇树科技创始人,直接领导机器人产品与技术路线运动控制、硬件成本、量产和人形机器人迭代
陈建宇清华大学研究者、星动纪元创始人强化学习、机器人操作和具身系统创业
楼天城小马智行联合创始人兼 CTO自动驾驶系统、世界模型和真实道路验证
韩旭文远知行联合创始人兼 CEOL4 自动驾驶、车队运营和安全验证
詹锟理想汽车基座模型与自动驾驶负责人VLA、车端推理、数据引擎和量产部署
俞涛逐际动力人形机器人基座模型负责人全身控制、强化学习和人形机器人训练
葛依笑小鹏机器人具身智能与数据负责人多模态模型、世界模型和机器人数据体系

芯片与计算系统

人物公开足迹与当前工作适合观察的问题
陈天石寒武纪创始人兼 CEO、智能处理器研究者AI 芯片架构、产品化和软硬件协同
陈云霁中国科学院计算技术研究所研究员智能处理器体系结构和计算效率
施路平清华大学类脑计算研究者、灵汐科技创始团队成员类脑芯片、软硬件协同和新型计算范式
邓仰东清华大学软件学院研究者AI 芯片设计、工业智能和计算系统
吴华强清华大学集成电路研究者存算一体、忆阻器和器件到系统的验证
尹首一清华大学集成电路研究者、清微智能创始人可重构计算、端侧 AI 芯片和工程落地

英文互联网的一线足迹

英文部分以 X 作为动态入口,同时保留个人主页和项目链接。帖子用于发现变化,代码、论文和产品文档用于确认事实。

生产级 Agent:从演示走到真实系统

Agent 领域最容易出现演示偏差。一个流程能在五次预设对话中成功,并不说明它能处理权限、工具故障、成本上限和脏数据。下面这组人值得关注,是因为他们持续讨论生产系统真正遇到的问题。

人物直接产物或工作适合观察的问题
Harrison ChaseLangChain 联合创始人LangGraph、Agent 运行时、可观测性,以及框架如何服务企业部署
Jerry LiuLlamaIndex 联合创始人企业知识库、RAG、文档工作流与数据接入
Hamel Husainhamel.dev 的 AI 工程实践评测集怎样建立,错误分析如何反过来改变产品
Shreya Shankar个人研究主页LLM 数据处理、评测工作流和复杂文档任务
Jason LiuInstructor 作者结构化输出、数据抽取、验证失败和 AI 咨询交付
Eugene Yaneugeneyan.com 的应用机器学习文章推荐系统、LLM 产品实验,以及线上指标怎样约束模型选择
Chip Huyenhuyenchip.com推理基础设施、生产机器学习和 AI 产品工程
Simon WillisonDatasette 与模型实验记录新模型的真实能力、工具调用、安全问题和可重复实验
Ankur GoyalBraintrust 创始人Prompt 版本、生产 trace、回归评测和开发工具的产品化
Omar KhattabDSPy 创造者怎样把提示词试错改造成可优化、可评测的程序
Dex HorthyHumanLayer 创始人Coding Agent 的上下文工程、人工介入和复杂功能交付
Flo CrivelloLindy 创始人面向业务用户的 Agent 怎样定价、收敛场景并承担执行责任

如果团队正在做企业知识助手,优先看 Hamel Husain、Shreya Shankar、Jason Liu 和 Ankur Goyal。他们提供的价值不在于再介绍一个框架,而在于展示开发者怎样构造测试集、发现失败类型,再决定是否允许系统进入生产环境。

模型与推理基础设施:判断能力边界

应用团队不必每天追逐模型榜单,但需要知道底层能力为什么变化。模型架构、推理效率和开源工具会直接改变部署成本,也会改变一个小团队能够承担的产品范围。

人物直接产物或工作适合观察的问题
Andrej Karpathy个人主页与教学项目从训练代码理解模型,而不是只记住产品名称
Georgi Gerganovllama.cpp 创建者端侧推理、量化、硬件适配和开源性能优化
Tri DaoFlashAttention 核心作者注意力计算、内存效率和模型架构的工程约束
Thomas WolfHugging Face 联合创始人开源模型生态、研究发布和模型分发方式
Jeremy Howardfast.aiAnswer.AI 创始人小团队怎样把研究成果变成可使用的工具
Soumith ChintalaPyTorch 联合创造者训练基础设施、框架演进和研究工程文化

这组账号更适合校正技术判断,不适合直接决定商业主线。一个新架构降低了推理成本,只能证明某些方案变得可行;客户是否愿意付费,还要回到具体工作流和替代成本。

经营一家技术公司:客户、定价和组织约束

技术创业的信息差经常不在模型,而在交易过程。谁拥有预算,客户为什么续费,低价项目为何拖垮交付,这些问题很少出现在融资新闻里。下面的人都经营过真实产品,其中多位经历过长期自筹资金发展。

人物直接产物或经历适合观察的问题
Jason CohenSmart Bear、WP Engine 创始人,长期文章市场规模、定位、增长上限和创始人取舍
Rob Walling多次 SaaS 创业,创办 TinySeed、MicroConf小型 B2B 软件怎样找到第一批客户并建立可重复销售
David CramerSentry 联合创始人兼 CTO开源 SaaS、开发者产品、工程质量和 AI 编程落地
Arvid KahlFeedbackPanda 创始人,The Bootstrapped Founder窄市场、客户访谈和自筹资金公司的增长边界
Pieter LevelsNomad List、Remote OK 等产品独立开发者怎样快速发布并直接收费;他的个人化技术方案不必照搬
Des TraynorIntercom 联合创始人AI 客服、产品战略和成熟 SaaS 面对 Agent 冲击时的选择
Jason Fried37signals 联合创始人小团队经营、范围控制和长期盈利
David Heinemeier HanssonRuby on Rails 创造者、37signals 联合创始人创始人亲自参与工程、云成本和组织设计的利弊
Tobi LütkeShopify 联合创始人兼 CEO技术创始人怎样管理平台型产品和大型工程组织
Guillermo RauchVercel 创始人开发者产品、前端基础设施和 AI 应用分发
Amjad MasadReplit 创始人AI 编程产品如何从工具走向用户可完成的任务
Mitchell HashimotoHashiCorp 联合创始人、Ghostty 作者开源项目、开发者工具和创始人回到一线工程后的工作方式

这组人的主张彼此并不一致。Jason Fried 倾向于控制组织规模,Tobi Lütke 管理的是大型平台,Pieter Levels 则依靠极小团队和个人执行。他们提供的是不同约束下的案例。读者应先确认自己的客户、资本和团队条件,再判断哪段经验可以外推。

视频生成与时序预测:模型怎样进入业务

视频生成和时序预测都有成熟的模型演示,但客户购买的不是演示。视频客户需要可发布的成片,预测客户需要能够改变排班、库存或资源配置的结果。关注下面三人时,应重点看产品怎样进入工作流。

人物直接产物或工作适合观察的问题
Cristóbal ValenzuelaRunway 联合创始人兼 CEO生成模型怎样进入专业创作流程,研究能力如何变成商业产品
Alex MashrabovHiggsfield 联合创始人兼 CEO视频生成的产品形态、创作者分发和商业化速度
Max MergenthalerNixtla 创始人开源时序预测、基础模型和企业数据场景

观察视频公司时,不能只记录清晰度和生成时长。还要看素材权属、人物一致性、修改次数和最终可用率。观察预测产品时,则要找比较基线、回测方式和决策成本。没有这些信息,模型指标很难转换成报价与验收条件。

机器人与物理世界 AI:演示之外的可靠性

物理世界会放大错误成本。机器人在视频里完成一次任务,不代表它能适应不同光照、物体和操作人员。这个领域的一手信息应尽量回到论文、数据集、现场实验和硬件约束。

人物直接产物或工作适合观察的问题
Chelsea FinnPhysical Intelligence 联合创始人、机器人学习研究者机器人基础模型、数据规模和泛化能力
Jim FanNVIDIA 机器人研究负责人仿真、具身智能和通用机器人的研究进展
Pieter AbbeelUC Berkeley 教授、Covariant 联合创始人强化学习、机器人操作和研究成果商业化
Sergey LevineUC Berkeley 教授、Physical Intelligence 联合创始人机器人学习、真实数据采集和大规模策略训练
Ted Xiao个人研究主页,Project Prometheus 创始技术成员能理解并作用于物理世界的前沿模型

研究团队发布的新能力可以帮助判断长期方向,却不能直接证明客户已经准备采购。面向工业客户时,仍要继续追问设备接口、停机风险、责任边界和现场维护成本。

AI 计算硬件:理解算力为什么贵

应用创业者通常不需要设计芯片,但需要理解算力价格背后的系统约束。训练和推理成本并不只由 GPU 型号决定,内存、互连、编译器和工作负载都会改变最终经济性。

人物直接产物或工作适合观察的问题
Jim KellerTenstorrent CEO、芯片架构师AI 芯片架构、硬件团队和开放计算生态
Andrew FeldmanCerebras 联合创始人兼 CEO晶圆级计算、训练系统和硬件公司怎样进入客户采购

把 80 人变成一套可维护的信息系统

一次性订阅所有动态会让高价值内容重新被信息流淹没。可以按正在解决的问题建立四个收藏组:

  • AI 系统:Agent、评测、模型和数据基础设施;
  • 开源工程:数据库、云原生、编程语言和开发者工具;
  • 技术经营:客户发现、定价、交付和公司组织;
  • 物理世界:视频、时序、机器人、自动驾驶和芯片。

每周不必整理全部帖子。只保存四类内容:本人完成的实验,自己公司的经营数字,真实客户部署复盘,以及带代码或数据的失败分析。保存时同时记录原始链接、发布日期和适用条件。以后若要引用,先检查项目是否已经更新,数字是否来自同一个统计口径。

还可以为重要账号设置一个简单的验证路径:

本人动态 / 个人博客 / 项目更新
  ↓ 找原始链接
代码仓库 / 论文 / 产品文档 / 经营复盘
  ↓ 检查样本、时间、基线和利益关系
可用于当前决策的事实
  ↓ 写明适用条件
技术选型、产品实验或客户访谈问题

一手信息的价值不在于它必然正确。它减少了一层转述,让读者能够看到原作者使用了什么数据、承担什么角色,又遗漏了哪些条件。对创业者而言,这种可追溯性比获得更多行业观点重要。观点可以继续更新,已经投入的时间和资金却很难撤回。