拥有1P算力,能干点什么?

​ 拥有1P算力,能干点什么? 之前聊过“什么是 1P 算力”,简单说,1P 算力通常指 1 PFLOPS,也就是每秒 1000 万亿次浮点计算能力。但知道这个定义之后,新的问题马上来了: 如果我真的拥有 1P 算力,到底能干点什么? 能不能训练大模型? 能不能跑本地 AI? 能不能支撑一个企业的智能体应用? 能不能让几百个人同时用 AI 助手? 这篇就不继续抠概念了,直接聊应用。 1P 算力不小,但也没那么神 先说结论:1P 算力不算小,但也没到“想干什么就干什么”的程度。 如果只是做 AI 推理,比如让已经训练好的模型回答问题、处理文档、写材料、做知识库问答,1P 算力已经能做不少事情。 但如果想从零训练一个真正意义上的大模型,1P 算力基本不够。 训练大模型不只是看算力,还要看显存、通信、数据量、训练时间、工程能力和资金投入。 ​ 1P 算力支持的典型应用场景⁠ 1P 算力大概是什么体量? 按 FP16 来粗略理解,1P 算力就是每秒 1000 万亿次半精度浮点计算。 但这个数字太大,一般也没有感觉。 更直观一点说,1P 算力它不像一台电脑,也不像一台服务器,更像是一个小型机房里的一组 AI 加速卡,大概可以理解为一个很小型的 AI 算力资源池。它不是“几台普通电脑”的概念,而是需要多张专业 AI 加速卡组合起来,才能达到的计算能力。 说法 普通理解 1P FP16 算力 每秒约 1000 万亿次半精度浮点计算 它不是一台电脑 通常需要多张 AI 加速卡组成 它不是万能指标 还要看显存、带宽、网络、利用率 它适合什么 推理、小模型训练、企业 AI 应用 它不适合什么 从零训练超大规模基础模型 拥有 1P 算力,可以干哪些事? 1. 跑大模型推理 所谓推理,就是模型已经训练好了,现在让它回答问题、总结材料、写代码、生成文案、分析表格、处理图片。 ...

我用WorkBuddy做了几件小事,才明白Agent是什么

前两天我人在外面,需要的一个文档在家里电脑中,这事说大不大,说小也不小。等回家当然能弄,打开电脑,找到文件,再处理需要的内容,十来分钟的活儿。但这种活儿最烦的地方也在这里:它不值得郑重其事坐下来处理,可它就是会一直挂在脑子里。 现在,在微信小程序里给 WorkBuddy 发一句话,让它连上家里电脑,看一下所需要的文件,并对文件进行一些操作,再顺手总结一下。撒泡尿的功夫,任务已经跑完了。 ​ 使用WorkBuddy 那一刻我才有点理解,为什么现在大家都在讲 Agent:不是因为它会聊天,也不是因为它能写几段漂亮话,而是它终于开始替你动手了。 前几天还有一条新闻:6 月 16 日,全国首个省级政务智能中枢“湾擎”上线试运行,同时预发布了湾擎·WorkBuddy,后面会面向广东全省公务员开放。这个新闻听起来很政务、很企业,这跟咱也没关系,说有点关系的话,那就是咱能不能拿来处理自己的日常杂事? 先一分钟搞清楚 WorkBuddy 是个啥 一句话:它是个桌面 / 全场景的 AI Agent,也叫智能体工作台。 跟你天天对话的那种 AI 不一样的地方在于——它不只是给你“答案”,而是真的把你电脑当成“AI 同事”来用:听懂你一句大白话,自己拆解任务、规划步骤、动手执行,最后交给你一个能直接验收的成品。能力上它跟开源的“小龙虾”OpenClaw、Hermes 类似、完全兼容这类 skills,但更省事也更安全——不用折腾环境,从下载安装到微信扫码登录,最快一分钟。 这一类产品现在其实不少,横向对比一下,心里有个谱: 产品 核心定位 更像什么 主要战场 腾讯 WorkBuddy AI Agent 桌面工作台 “办公智能体入口” 企微、腾讯文档/会议、政务办公 阿里悟空 企业级 AI 工作平台 “钉钉里的 AI 员工军团” 钉钉、审批、日程、企业流程 Claude Cowork 知识工作的桌面 Agent “会操作本地文件的 Claude” 文件整理、研究综合、文档生成 OpenAI Codex 编码 Agent / 云端执行器 “云端 AI 工程师” 代码库、PR、调试、自动化 Claude 的 Cowork、阿里的悟空、OpenAI 的 Codex 都在做同一件事,只是切入口不同。排除掉 Claude 和 Codex 的网络问题,国内能开箱即用、又跟微信生态长在一起的,目前确实是 WorkBuddy 最顺手。它属于腾讯 CodeBuddy 产品线下的一个分支——CodeBuddy 就是腾讯版的 Codex,也很能打,这个以后单开一篇聊。 ...

了解一下图片暗水印

聊这个话题之前先看看下面这两张图片,能看出来有什么区别吗? 图片一 图片二 直观来看,左图左下角有文字水印,右图是“原图”。其实除了画面内容,两张图片承载了相同的文字信息,只不过右图不是明文显示,而是通过暗水印的方式把文字藏了进去。 关于暗水印 图片暗水印(也叫隐形水印、盲水印)是一种把标识信息嵌入图片内部、肉眼看不见但能被算法提取出来的技术。和传统明晃晃的文字水印(明水印)不同,暗水印不破坏画面观感,主要用于版权追踪和泄露溯源。 典型用途 版权追踪: 比如摄影师、设计师、平台给图片加入暗水印,后续即使别人裁剪、转发,也可能检测出原始来源。 平台溯源: 有些社交平台、图片平台、AI 图片生成工具,可能会在图片里加入隐藏标记,用来判断图片来源、生成工具、上传渠道等。 防盗图: 即使别人把明水印裁掉,只要暗水印还在,就可能证明图片来源。 AI 生成图片识别: 一些 AI 图片系统会尝试给生成图加入不可见标记,用于说明“这张图可能由 AI 生成”。(借助 AI 工具生成的视频、图片,会被抖音、视频号、小红书等平台识别出是 AI 生成的作品,可能就是这个原理。) 暗水印不等于 EXIF 信息 很多人容易把两者混在一起,EXIF 信息是照片文件里的元数据,比如: 1 2 3 4 拍摄设备:iPhone 拍摄时间:2026-06-21 GPS 位置: 镜头参数: 这种信息比较容易被查看,也容易被删除。但暗水印一般是嵌进图片内容本身的,即使你删掉 EXIF,它可能还在。 做个小实验 核心原理很简单:明文 → AES-GCM 加密 → LSB 隐写嵌入 PNG 图片 → 接收端逆向提取。 ...

快捷指令终于有“全局变量”了!

升级到 iOS 27 beta 1,本来只是想看看系统是不是更顺手了。用了几天下来,发现快捷指令里一个很不起眼的改动——快捷指令总算有了点“全局变量”的味道。常折腾它的人大概懂,这真不算小更新。 升级到 iOS 27 beta 1 之后 先说系统本身。 升级之后,手机整体用起来确实更顺了一些,每天划来划去、打开关闭 App、切换页面的时候,能感觉到它比之前更轻一点。 我自己比较在意的地方主要有三个。 1. Liquid Glass Liquid Glass效果 这个效果之前看介绍的时候,我其实没太大感觉。因为这类视觉更新,很容易在宣传图里显得高级,真正用到手机上又是另一回事。但这次实际用下来,它确实比我想象中舒服。透明、折射、层次感这些东西没有那么“炫技”,反而是日常看着更干净了一点。 2. 景深效果 iOS27主题景深效果<br> 鼠标悬浮在图片上移动鼠标可以看到景深效果动图 手机主题和锁屏里的景深效果,好像也比以前好了不少。图片和时间、组件之间的前后关系更自然,不像之前有时候会显得硬贴上去。当然这个感受比较主观,也可能跟我这次换的壁纸有关,但整体观感确实比之前顺眼。 3. 快捷指令又变了 iOS27快捷指令新增功能 每次系统升级,我最怕的其实不是耗电,也不是卡顿,而是快捷指令。 因为快捷指令这东西很奇怪:平时用得好好的,一升级系统,它就可能突然这里坏一点,那里报个错。最麻烦的是,官方通常也不会很详细地告诉你,到底哪些动作改了,哪些逻辑变了。 这次也一样。 我原来用的几个快捷指令,被搞得七七八八不能正常运行。只能重新备份、修改、删除、新建,一点点把流程修回来。折腾的过程挺烦,但也正是在这个过程中,我发现了一个新功能——“储存空间”。 说实话,Apple 这个名字起得有点绕,如果直接叫“全局变量”,反而更容易理解。 快捷指令里的“储存空间” 这个功能藏在快捷指令的“脚本”里面,名字叫“储存空间”。 点进去之后,里面主要有三个动作: 储存内容:把传入的内容按指定名称存起来。这个内容不会因为快捷指令运行结束就消失,后面还可以继续取出来用。 获取已储存内容:按照名称,把之前存过的内容取出来。 删除已储存内容:把指定名称下保存的内容删掉。 这三个动作放在一起,意思就很清楚了。 我举个自己正在用的例子: 全局变量的使用 我做了一个跟写作选题有关的快捷指令,需要给每个选题自动生成编号。以前如果想实现这个功能,要么借助备忘录、文本文件、Data Jar 这类第三方工具,要么绕一堆很麻烦的逻辑。 现在简单多了。 创建一个名为“选题编号”的快捷指令。 在里面使用“脚本”里的“储存空间”,选择“储存内容”,把编号“001”存进去,并给它起一个名字,比如叫“第几个选题”。 这样,一个最简单的全局变量就有了。 使用这个全局变量 后面另一个快捷指令要用这个编号时,就直接通过“获取已储存内容”,读取“第几个选题”这个值。 读取之后,用它生成当前选题编号。 流程结束前,再让这个编号自增 1,然后把新的编号重新写回“第几个选题”。 也就是说,第一次运行是 001,下一次就是 002,再下一次就是 003。 这个功能其实能解决很多小麻烦 快捷指令最有意思的地方,就是它看起来只是几个动作拼来拼去,但只要能保存状态,它就不只是“一次性工具”了。 可以记录某个流程上次运行到哪里。 可以保存某个计数器。 可以记住某个开关状态。 可以给选题、文件、录音、截图这些东西自动编号。 可以把一些常用配置放进去,之后所有相关快捷指令都从这里读取,不用每个快捷指令里都手动改一遍。 这跟写程序里的全局变量、配置文件、状态存储有点像。对于普通用户来说,不需要理解这些概念;但对喜欢折腾自动化的人来说,这个变化很关键。 ...

换种问法,AI给的答案能差多少?

又做了一个实验 在上一篇里,我把同一段文字丢给好几个不同的 AI 工具,让它们各自总结一遍。材料一模一样,结果却挺不一样:有的抓住了重点,有的会自作主张补几句“听起来很合理、原文却根本没写”的话,还有的把原文里含含糊糊的说法,硬讲得斩钉截铁。那次之后,我对“幻觉”这件事有了更具体的感受——它不是简单的“我不知道”,而是会一本正经地,把没把握的东西说得跟真的一样。 换种问法,AI给的答案能差多少? 这一次,我换了个思路。 上回是“同一段材料,喂给不同的模型”;这回反过来,只用一个模型,让它做同一件事,但每次换一种问法。说白了,就是改 prompt(提示词)。 同样一个模型,任务大方向也没变,只是问法不同,我想看看: 它给出来的内容,差别到底有多大? 是只换了个说法,还是连理解的重点都跟着变了? 是写得更准了,还是更容易跑偏? 于是有了下面这五种问法: 序号 Prompt 类型 Prompt 内容 1 普通总结版 总结一下下面这段内容:【材料】 2 字数限制版 请用 100 字以内总结下面这段内容:【材料】 3 结构化总结版 请按以下结构总结:①发生了什么 ②原因是什么 ③影响是什么。【材料】 4 防幻觉约束版 请只根据原文总结,不要加入原文没有的信息;如果原文没提到原因、影响或结论,就直接写“原文未提及”。【材料】 5 证据对应版 请总结下面这段内容,并把每条结论对应到原文依据。格式:结论+对应的原文句子。【材料】 这五种,其实正好对应我们平时用 AI 的几个层次:随手一问 → 加一点限制 → 给它一个结构 → 要求它别乱编 → 最后逼它拿出证据。 实验结果我没有一条条贴出来——这种东西自己试最直观。随便找段新闻或者资料,把上面五种问法挨个套一遍,差别一眼就看得出来。 我真正想搞清楚的是:面对同一段材料,这个 AI 到底是“理解稳定”,还是很容易被问法牵着走。如果只是表达风格变了,那 prompt 影响的主要是“它怎么说”;可如果连事实重点、因果关系、甚至结论都跟着变,那就值得警惕了——因为这说明,我们跟 AI 对话时,问法本身就在悄悄塑造答案。 既然问法这么关键,那怎么问才靠谱?下面是我自己常用的几样东西。 30 秒快速自检 敲回车之前,花半分钟过一遍这四件事: 动作:到底要它做什么?别写“处理 / 优化 / 弄一下”,写清楚是“新增 / 只改 / 重写 / 标注”。 对象:改的是哪个?别用“这个 / 它 / 那段”,直接给出文件名、函数名、单元格。 范围:边界在哪?少用“所有 / 全部 / 相关 / 顺便”,明确说清楚包含什么、排除什么。 验收:怎样算做对了?比如签名不变、测试跑通、控制在一页、不超纲。 凡是带副作用的操作(改文件、拉数据、删除、下单、推送),我都会默认补一句:“先列出你要做的,等我确认再执行。” 就这一句,能拦掉绝大多数“方向对了、范围却搞大了”的白白烧 token 的操作。 ...

了解Ai大模型的幻觉

跟AI工具进行对话时,刚开始聊着聊着还挺好,聊一会就明显感觉这伙计开始胡编乱造了,尤其是免费版的AI工具,付费版的还会陪你聊一会,可能不耐烦了之后也就开始应付着出现幻觉了。 AI模型的幻觉 问问AI 这个问题又去问了一下AI——还是人家不怕自相矛盾——给出了两个网络资源,一篇学术论文和一篇有营销嫌疑的博客文章; Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards:https://arxiv.org/pdf/2505.04847 LLM Hallucination Index 2026: Why Claude 4.6 Sonnet Dominates BullshitBench v2 While Reasoning Models Fail:https://medium.com/@anyapi.ai/llm-hallucination-index-2026-why-claude-4-6-7b2d13ed9f0c 其中,论文聚焦的核心概念是忠实度(faithfulness):模型生成的内容是否严格基于给定上下文,不引入无依据信息、不曲解、不自相矛盾。这与“事实正确性”不同——一句话可能符合世界知识,但只要原文没说,在 RAG 场景里也算不忠实。作者指出一个反常识的事实:RAG 本意是用检索到的可信上下文来“锚定”模型回答,从而压制幻觉,但即便上下文已经给到模型,LLM 仍频繁添加原文不支持的细节、歪曲信息甚至直接矛盾。更棘手的是评测端:无论是微调的检测模型还是 LLM-as-a-judge,识别幻觉的准确率都不理想。作者特别提到一个令人沮丧的发现——在专门设计来“挑刺”的 FaithBench 数据集上,包括用 LLM 做分类在内的现有方法,准确率徘徊在 50% 左右,几乎等于随机猜。博客文章主要论点有三个:一是“推理悖论”,声称对 GPT-5.2、Gemini 3 Pro 等多数模型来说,加大推理算力反而降低识别假前提的能力,模型会把额外算力用来给错误“圆谎”;二是把 Claude Sonnet 4.6 捧为“唯一默认带怀疑精神”的模型(声称 91% 检测率、3% 幻觉率);三是说 OpenAI、Google 因过度 RLHF 变成“yes-man”,卡在 55–65% 区间。开源方面把 Qwen3.5 列为主要替代。 文论附录 论文附录给出了用 FaithJudge 对 12 个模型综合四个子任务的幻觉率排名(从低到高,越低越好): 排名 模型 综合幻觉率 1 gemini-2.5-pro 6.65% 2 gemini-2.0-flash 10.18% 3 gpt-4.5-preview 11.94% 4 o3-mini-high 12.52% 5 gpt-3.5-turbo 14.87% 6 gpt-4o 15.85% 7 claude-3.7-sonnet 16.05% 8 llama-3.3-70b 16.44% 9 phi-4 17.03% 10 mistral-small-24b 17.03% 11 llama-4-maverick 20.55% 12 llama-3.1-8b 28.38% 论文引用CNN 关于福建漳州工厂爆炸这则新闻来对每一个AI工具进行测试,从 用户问题、检索到的资料、模型回答、错误片段、为什么错、正确说法、证据来源这几个维度来测试并得出幻觉率排名。 ...

理解什么是“1P”算力

常说的拥有某数据中心拥有“**P算力”,这里面的算力是什么呢? 什么是“1P”算力 网络上搜索一些内容,整理如下: “1P算力”里的 P 是数量级前缀 Peta(10¹⁵,千万亿),所以“1P算力”通常指 1 PFLOPS,即每秒 1×10¹⁵ 次浮点运算(1000万亿次/秒)。 1. 单位是 FLOPS,不是 FLOP。 算力的常用单位是 FLOPS(每秒浮点运算次数),是个速率。 1P = 1000T(TFLOPS)= 100万G(GFLOPS) 所以业内说的“1P卡”、“100P集群”基本都是指 PFLOPS 规模。 2. 必须看精度,否则数字没意义。 同一张卡在不同精度下算力差好几倍,“1P算力”本身是不完整的说法。完整的应该是包含FP64、FP32、TF32、FP16、BF16、INT8,还是 INT4? 本篇内容以“1P”的说法为入口,了解了解这方面的基础知识。 相关概念: 以一个实例开始: 一张 NVIDIA H100,FP16/BF16 峰值约 1 PFLOPS 量级(开稀疏更高),所以“1P”差不多就是“约一张高端 AI 卡”的体量。 “百P算力中心”“千P智算集群”这类说法,就是把成百上千张这种卡堆在一起的总峰值。 算力单位相关 FLOPS:全称 Floating Point Operations Per Second,即“每秒浮点运算次数”,是衡量算力的速率单位。注意结尾的 S 是 Second(秒),不是复数。 FLOP:去掉 S,指“一次浮点运算”本身,是个数量而非速率。训练一个模型“总共要算多少次”用 FLOP(或 FLOPs,小写 s 表示复数次数),“每秒能算多少次”用 FLOPS。两者常被混用,但严格意义不同。 浮点运算:对带小数的数字(浮点数)做的加减乘除等运算。之所以强调“浮点”,是因为它和整数运算的硬件实现、速度都不同,神经网络里大量是浮点计算。 Peta / P:国际单位制的数量级前缀,10¹⁵(千万亿)。同系列还有 G(Giga,10⁹/十亿)、T(Tera,10¹²/万亿)、E(Exa,10¹⁸/百亿亿)。换算:1P = 1000T = 100万G。现在最顶级的超算到了 E 级(ExaFLOPS)。 精度相关 精度:指一个数字用多少位(bit)来表示。位数越多,能表示的数值范围越大、越精确,但占的存储和计算资源也越多。AI 领域为了提速和省显存,倾向用更低的精度。 ...

修复 yuque-exporter 的三个 bug

语雀文档批量导出工具 yuque-exporter 在首次运行、本地文件缺失、redirect 处理等场景下存在崩溃问题,记录定位和修复过程。

讯飞录音笔云端数据本地备份

讯飞录音笔云端数据本地备份 讯飞录音笔录音本身在云端,转写、AI 总结、思维导图也都在网页端能看到,但真到需要长期整理时,只靠网页端不太方便:文件分散,账号切换容易混,后续要搜索、归档、再加工也不顺手。 iflytekRecordDownload 就是为这个场景写的一个小工具。它从讯飞录音笔网页端读取云端录音列表,把录音音频、转写文本、AI 总结和思维导图同步到本地。同步后的文件按账号、日期和录音时间组织,适合长期备份。 它解决什么问题 这个工具主要做几件事: 下载每条录音对应的 WAV 音频。 导出转写文本为 Markdown。 同步云端生成的 AI 总结和思维导图。 按不同讯飞账号分目录保存。 按录音当天日期建文件夹,同一天多条录音再按时分秒区分。 自动生成当天的转写合并文档,方便快速回看。 最后得到的目录大概是这样: 1 2 3 4 5 6 7 8 ~/录音笔同步/工作账号/ 2026年05月14日/ 17时26分49秒.wav 17时26分49秒.md 17时26分49秒_AI总结.md 17时26分49秒_思维导图.md 17时26分49秒_raw.json 2026年05月14日_转写合并.md 这个结构的好处是后续处理很简单。音频、转写、总结和思维导图都在同一个时间点下面,不需要再从一堆文件里猜谁和谁对应。 实现思路 讯飞录音笔网页端本身会调用接口读取录音列表和详情。工具没有绕过登录流程,而是让用户先在浏览器里正常登录,然后从开发者工具里复制一次 Copy as cURL。脚本会从这段 cURL 里解析出 X-Session 和 X-User-Id,再用同样的登录态去访问云端接口。 ...

钉钉DingTalk音频导出到本地

把钉钉DingTalk A1音频导出到本地 做了一个小工具:把钉钉DingTalk录制的 AI 听记完整下载到本地。 钉钉DingTalk是一款很好的个人效率工具,硬件端录制的音频由钉钉通过通义千问Qwen3-235B、DeepSeek-V3-671B满血版大模型 AI纪要总结,除了录音,还有转写、AI 纪要、笔记、章节、分析、关键词、待办。但这些内容平时都散在钉钉app里,想备份、整理、二次处理都不太方便。所以做一个本地导出工具,一次性把这些东西都拉下来。 项目基于这个开源仓库改的: 1 https://github.com/DingTalk-Real-AI/dingtalk-workspace-cli 原项目提供了一个叫 dws 的命令行工具,可以通过钉钉授权访问 AI 听记、文档、云盘、日程等能力,在这个项目基础上加了两个脚本: 1 2 scripts/archive-all-minutes.sh scripts/download-all-minutes-audio.sh 第一个脚本负责完整归档,第二个脚本只下载音频。 一开始只是想把录音下载下来。后来发现听记接口还能拿到更多内容,比如转写原文、AI 纪要、关键词、待办、思维导图状态等,于是就把脚本扩成了完整归档。 DingTalkExport 现在运行: 1 scripts/archive-all-minutes.sh 它会把内容下载到项目根目录下的 download/ 文件夹。每条听记一个目录,目录名用钉钉听记的创建时间,比如: 1 download/20260507_65871790/ 目录里会有这些文件: 1 2 3 4 5 6 7 8 9 10 11 12 13 14 audio.mp3 transcription.json transcription.tsv summary.json ai-summary.md notes.txt analysis.txt chapters.tsv keywords.json todos.json info.json mind-graph-status.json audio-url.json list-item.json 其中 audio.mp3 是录音,transcription.tsv 是整理过的转写文本,ai-summary.md 是 AI 纪要,notes.txt 和 analysis.txt 是从纪要里拆出来的笔记和分析内容。 ...