读研最怕的不是没工具,是没有自己的龙
读研最怕的不是没工具,是没有自己的龙最近读到一篇讨论AI工具热潮的文章,作者提了一个很尖锐的观察:全国一半的AI Agent每天在给主人发天气预报,另一半在发新闻简报——而这些事,手机免费就能干。 看到这里我笑了,因为我自己也干过类似的事。 刚接触Claude Code的时候,我花了大量时间搭技能模块、配MCP工具链、研究各种Prompt模板。折腾完了,坐在屏幕前,突然发现——嗯,然后呢? 工具倒是磨快了,但砍什么? 这个问题,放到我们读研的语境里,更扎心。 你的”问题资源”是什么? 原文提出了一个概念叫问题资源。意思是:当AI已经能给出不错的答案时,真正稀缺的不再是解题能力,而是你手里有没有值得去解的题。 谁拥有问题,谁就拥有调度工具和系统的权力。 读研不就是这样吗? 导师给你一个方向,你读了几十篇论文,跑了几个baseline,然后呢?你的contribution是什么?你发现了什么别人没发现的问题? 我见过两种研究生: 一种人工具玩得特别溜,YOLO各版本如数家珍,训练脚本写得飞快,但你问他”你这篇论文到底解决了什么问题”,他支支吾吾半天,最后说”我把mAP提了两个点”...
从本地 Demo 到公网可用:路遥 AI 的低成本部署实录
从本地 Demo 到公网可用:路遥 AI 的低成本部署实录 本地能跑,只证明代码在我的电脑上成立。真正把一个带后端、数据库和 API Key 的 AI 应用交给别人用,还要同时解决网络、部署、密钥、冷启动和数据持久化。 上一篇《不是接一个 TTS:我如何把 61 秒视频重构成有记忆、有情绪的 AI 伴侣》,我讲了路遥 AI 的多 Agent、声音复刻、多气泡、上下文和长期记忆。 代码重构完以后,我很快撞上了另一个问题:它在本地可以聊天、可以说话,也可以写入 ChromaDB,但我一关电脑,别人就完全用不了。 更麻烦的是,这不是一个纯前端网页。它需要 FastAPI 常驻运行,需要访问 MiniMax,需要保存 API Key,还要限制陌生人无限调用付费接口。把它传到 GitHub,不等于它已经上线;把端口暴露到公网,也不等于它可以安全分享。 这篇只复盘一件事:我怎样用一套尽量低成本的方案,把本地 Demo 变成一个别人可以访问、密钥又不会落到浏览器里的在线应用。 01|本地能跑和别人能用,中间隔着两层应用 路遥 AI 里,FastAPI 和 Gradio 不是两个重复的 W...
不是接一个 TTS:我如何把 61 秒视频重构成有记忆、有情绪的 AI 伴侣
不是接一个 TTS:我如何把 61 秒视频重构成有记忆、有情绪的 AI 伴侣 我这次真正意识到:情绪共鸣不是一句“请温柔一点”的 Prompt,而是记忆、信息顺序、停顿、声音、气泡节奏和上下文连续性共同形成的结果。 前阵子,我拿到了一段 61.6 秒的标杆视频。视频里,用户问“前女友结婚该送什么”,AI 没有马上解释一大段,而是先提到一台基础款白色拍立得。 用户追问“你怎么知道”,它才慢慢带出拍糊的合照、楼下凉掉的奶茶,以及那段关于等待和替代品的独白。 原项目其实已经能聊天:有 Prompt、有向量检索、有接口,也有一个 Gradio 页面。但把它和视频并排放在一起,我马上发现,能回答和像一个人回应,中间差的不是一个语音接口,而是一整条情绪执行链。 这篇只讲我怎样把这条链路重新搭起来。至于它后来怎样从本地 Demo 走到公网,我放到下一篇单独复盘。 01|61 秒标杆让我看见:像不像,不是文案问题 我没有先改 Prompt,而是先把视频当成一段需要验收的系统行为。 用 FFmpeg、波形和转写对齐后,视频全长约 61.6 秒。用户第二次追问结束后,路遥没有立刻开口,而是留了...
研路炼钢 | Jetson 的 8GB 到底算内存还是显存?和 Mac 对照后,我终于想明白了
研路炼钢 | Jetson 的 8GB 到底算内存还是显存?和 Mac 对照后,我终于想明白了 统一内存省掉了 CPU 和 GPU 之间的一部分数据搬运,但没有凭空多出一块显存。Jetson 标称的 8GB,不是“8GB 内存再加 8GB 显存”,而是整台机器共同争抢的一笔预算。 前几天我在看 Jetson Orin Nano 8GB 的资源状态,脑子里一直有一个很朴素的问题:这台机器写着 8GB 内存,GPU 跑模型时,到底还有没有自己单独的一块显存? 这个问题之所以容易绕,是因为我平时同时在用 Mac 和带独立显卡的机器。Mac 经常说“统一内存”,显卡机器又习惯把系统内存和显存分开算。把这几套经验直接套到 Jetson 上,很容易得到一个错误预期:系统还有 5GB 可用,GPU 应该还能再拿出一块显存。 我把一次空载采样、官方内存架构说明和本地模型的实际占用逻辑放在一起看后,才真正想明白:看一台边缘设备能不能跑模型,不能只看包装盒上的容量,必须看任务启动前后,公共内存池里还剩多少预算。 01|我一直把“内存”和“显存”想成两个账户 在传统台式机上,这种理解大体没问题。...
研路炼钢 | 我把 Vercel、Supabase 和 Surge 都连上了,但这还不叫工作流
这两天,我把 Vercel、Supabase 和 Surge 依次接进了自己的工具箱。 Vercel 能看见项目,博客页面实际返回了 200;Supabase 能读到组织和两个项目;Surge 能列出五个站点,五个地址也都能正常打开。 如果只看仪表盘,这已经是一片绿灯。 但我很快意识到:三个工具都能用,不等于三个工具已经一起工作。 登录成功,只能证明钥匙是真的;页面能开,只能证明炉子还热着。真正的工作流,必须让一块原料从入口进炉,经过加工、落库、验收,再带着证据回到我手里。 01|三个工具都亮了绿灯 先说现场。 Vercel 这边,连接器能正常读取账号下的项目,博客部署也能直接访问。我请求线上页面,拿到的是 200,页面标题也和预期一致。 Supabase 这边,组织与项目列表可以正常读取。两个现有项目分别在东京和新加坡,只是当时都处于暂停状态。这个结果至少说明:账号、权限和管理通道是通的;要进入业务链路,还需要先恢复目标项目。 Surge 更直接。命令行列出了五个站点: linkable-board.surge.sh aidatabase-squ.surge.sh aida...
研路炼钢 | 我把自己外包给 AI 一周后,发现真正不能外包的是判断
研路炼钢 | 我把自己外包给 AI 一周后,发现真正不能外包的是判断 AI 可以替我检索、拆解、执行和校验,但不能替我决定什么值得做。主控的价值不是让更多窗口同时忙,而是把碎片推进成有证据的交付。 前几天我和舍友聊天,他说自己对 AI 的使用程度可能只有 10%,而我已经到了 70%。 他又补了一句:你几乎什么都问 AI,会不会慢慢没有自己的思考? 这句话让我停了一下。 一周前,我刚写完上一篇文章:《我想把自己外包给 AI,最后先搭了一座“控制塔”》。当时我想得很完整:用一个空白项目做主控,再把论文、代码、博文和知识库分发到不同窗口推进。 真正跑了几天以后,我发现设计一个系统不难,难的是给系统装上刹车。 个人主控最重要的能力,不是帮我启动更多事情,而是更早地决定:哪些事情今天不启动。 01|70% 都问 AI,不等于 70% 没有思考 我确实会把很多问题交给 AI。 查资料、拆任务、读代码、检查引用、生成初稿、排查报错,这些工作如果都靠我一个人串行完成,时间很快就没了。AI 在这些地方像一组可以随时调用的外部进程,能帮我省掉大量机械切换。 但“把问题交给 AI”和“把判断交...
研路炼钢 | 我想把自己外包给 AI,最后先搭了一座“控制塔”
研路炼钢 | 我想把自己外包给 AI,最后先搭了一座“控制塔” 多窗口不是生产力系统。没有主控、并发上限和验收回流,窗口开得越多,只是在用更高级的方式制造上下文切换。 有一次,我盯着 Codex 里一排正在工作的窗口,突然不知道自己应该先点开哪一个。 一个窗口在跑论文实验,一个窗口在改项目代码,一个窗口准备博文和配图,还有一个窗口在整理知识库。每个窗口都很忙,每件事也都看起来有价值。 问题是,我自己反而成了最忙的那个调度器:不断切窗口、补背景、确认方向、处理新的想法,再去检查哪些任务到底做完了。 我原来想把自己外包给 AI。后来发现,真正需要外包的不是“我”,而是我的项目调度系统。 01|我以为自己缺的是一个更强的 Agent 最开始,我的解决办法很直接:任务多,就多开几个窗口;一个模型不够,就再加一个 Agent。 这套方法确实有效。AI 可以读论文、写代码、做图、检查材料,也可以同时推进几个互不相关的项目。以前需要排队处理的事情,现在可以并行。 但能力被放大之后,我原来的行为模式也被放大了。 我本来就容易“全都要”。看到一个想法会先启动,碰到一个项目会顺手优化,工具能跑...
研路炼钢 | 复盘六个获奖项目后,我终于明白:平台愿景为什么打不过一条证据链
研路炼钢 | 复盘六个获奖项目后,我终于明白:平台愿景为什么打不过一条证据链 比赛结束后,我和一位队友把获奖展板重新看了一遍。最初得出的结论很粗暴:有实物,大于无实物。再往下拆,我发现真正拉开差距的不是那块硬件,而是它背后那条能被看见、被测量、被追问的证据链。 先说明边界:这篇文章只依据现场展板、演示和个人记录复盘,不代表官方评审结论。涉及个人的信息均已脱敏,对评分动机等无法验证的内容也不作事实判断。为保护参赛者信息,正文配图使用脱敏重绘。 01|我一开始只看见了“有实物” 我们学校是第一次做这种跨学院合作,校内是三选一。现场有长期参赛的学校,选拔强度大约是六选一;也有学校八支队伍来了四支。有人已经在这个赛道积累了十余年,我们则刚把第一套合作流程跑通。 从结果看,获奖作品里确实有不少硬件、传感器、穿戴设备和真实部署图。于是我很容易把它归因为:有实物的项目更占优势。 但这个结论只对了一半。 实物本身不会自动产生创新。它真正提供的是一种“信任压缩”:评委在几分钟里能看到输入从哪里来、算法处理了什么、输出怎么测、最后放到哪里用。纯软件当然也能做到,只是必须用更扎实的实验和真实数据...
一次局域网部署排障:为什么 Linux 能访问,Windows 却不行?
今天折腾了一个看起来很简单、但实际很容易卡住的问题:在同一个内网里部署一个本地服务,让其他设备都能访问。 一开始我是在 Linux 上跑的。服务启动之后,本机能打开,局域网里的其他设备也能访问。后来我又在 Mac 和 Linux 之间试了几次,访问链路都是通的。到这里我基本确认两件事: 服务本身大概率没有问题。 当前局域网环境大概率也没有问题。 但问题出现在 Windows 上。 同样是把服务部署起来,换到 Windows 机器之后,本机看起来可以运行,但同一个内网里的其他设备就是访问不了。这个现象很典型:服务好像没坏,网络也不像完全不通,但从其他设备连进 Windows 这一步卡住了。 先把问题分层 这类问题最容易让人一上来怀疑代码、框架、前端页面、端口、路由,甚至怀疑是不是整个局域网有问题。 但如果 Linux 和 Mac 都能正常访问,就说明问题不能简单归结为“服务不可用”。 更合理的排查方式,是把它分成几层: 服务有没有真的启动? 服务监听的是 127.0.0.1 还是 0.0.0.0? 端口有没有对外开放? Windows 防火墙有没有拦截入站连接? Windo...
我用 AI 做了一个 20 秒视频,最后把项目删了
我用 AI 做了一个 20 秒视频,最后把项目删了 工具真正留下来的,不一定是那个文件,而是你对工作流的理解。 前几天,我用 AI 折腾了一个 20 秒的网站产品宣传片。 流程看起来挺完整:抓网页截图,做动画,配旁白,加 BGM,导出 MP4。中间还试了几版配音,从 macOS 自带语音,到 MiniMax 的 MMX 声线,再到背景音乐和音量混合。 最后的结果也确实出来了。 但有意思的是,折腾完之后,我把整个项目删了。 这件事反而让我意识到一个很实际的问题:AI 工具的价值,不只是“生成一个东西”,而是让你看清一个东西是怎么被生成出来的。 我一开始以为是在做视频 本节摘要:这节讲的是“做视频”其实不是单纯剪辑,而是在搭一条 HTML、CSS、动画、音频、渲染组成的工程流水线。 刚开始的目标很简单:把一个网站变成一个 20 秒产品 promo。 于是我让 HyperFrames 来做这件事。它的逻辑不是传统剪辑软件那种“拖素材到时间线”,而是把视频当成一个 HTML 工程。 网页截图是素材。 CSS 是画面。 GSAP 是动效。 音频轨是旁白和 BGM。 最后浏览器逐帧渲...










