
我们一定经历过这样的 AI 崩溃时刻——
写万字调研报告,前半段刚确认的政策口径,后半段就开始自行“变形”;做行业研究,引用了几十个网页,最后却找不到一条数据的准确出处;续写长篇小说,明明喂进了人物设定,写到第十章,人设已悄悄漂移。
这不是因为 AI 不够聪明,是因为今天大多数 AI,仍然缺一套真正为长项目设计的工作系统。

今日,元石科技正式发布 问小白 5 Pro——一款定位独特的新一代长内容生成引擎。它不卷参数,不拼代码,死磕一个所有人都绕不开、却长期被忽视的场景:长内容创作。长内容交付,更长更可信。
通用 AI 解决的是“这一轮怎么答”,问小白 5 Pro 解决的是“这个项目怎么做完”。
如果整篇文章只记一件事,记住三个字就够了:长、稳、可查。
——长,是输入能吞下海量资料,输出能一气呵成不截断;
——稳,是数万字里人设、结构、事实始终如一,不漂移;
——可查,是每个关键结论都能一键溯源,点回原文出处。

新一代长内容生成引擎,AI 时代的工作平台
长内容真正的痛点,并非上下文窗口不够长。当任务横跨数天、文本累积数万字,几乎所有大模型都会撞上同一道结构性暗礁:前文设定被遗忘,引用来源对不上,多轮改写后事实口径不一。
面对困局,常见的思路是“扩大内存”。但更长的窗口只是容纳了更多数据,并未解决数据的“管理危机”。长程任务的本质挑战,在于每一步都需要精准调度——读取什么、保留什么、写回什么、卸载什么,以及最终成稿中哪些来源必须严格可溯。
简言之,它将大模型的“持久记忆”建立在原生文件系统之上。对用户而言,文件沙箱并非看不见的后台模块,而是一个可查看、可编辑、可回溯的项目目录,资产库、文件树——你上传的资料、AI 检索的网页、生成的大纲、每一版草稿、引用来源及待办事项,全部固化于此。
由此,AI 每次继续任务时,不再依赖聊天记录“猜测”当前进度,而是直接打开相关文件,精准定位项目阶段。问小白 5 Pro 以此构建了一套大模型工作记忆系统,通过文件沙箱与项目资产库,将零散文档转化为可随时读取、动态回写的结构化资产,让 AI 创作真正拥有了全局视野。
当长内容生成进入持续协作阶段,它承载的便不再只有一篇文稿,还包括资料组织、项目记忆、版本迭代和完整的生产流程。一个面向 AI 时代的工作平台,也由此逐渐成形。

深度评测长程任务,到底可以交付什么?
问小白5 Pro的使用场景中,深度包含工作和写作两大长文写作场景,在调研报告、运营方案、小说写作、社媒写作、设计方案、商品广告等方向,有非凡的表现。
一份 15,000 字的 AI 行业估值深度报告。
让问小白 5 Pro 撰写一份覆盖 OpenAI、Anthropic、xAI、MiniMax、智谱 AI 、Deepseek六家公司的 2025-2030 年估值预测报告,对标投委会内部标准:六大章节、数十张数据表格、P/S+DCF 四维交叉验证模型。最终交付物里,全球 AI 市场规模测算、六家公司产品矩阵与营收预测、逐年估值对比、风险事件冲击矩阵一应俱全。文件沙箱中沉淀了完整的调研笔记、引用来源和迭代版本——报告里每个估值数字都能回溯到它被推导出来的那一步。

传送门:https://www.wenxiaobai.com/sp/18773e3d-de30-428b-ba99-a8a7a5ddf132/HEqsjKScrHCEL9e9IThK-
一份 12,000 字的全球跨境运营方案。
品牌 VOLTARC 闪狐需要一份覆盖北美与东南亚、横跨 Amazon、Shopee、TikTok Shop 三平台的完整运营方案。问小白 5 Pro 交付了五大模块:品类市场数据仪表盘、品牌定位与视觉风格指南、三平台店铺装修蓝图(含 A+ 页面框架、Shopee 东南亚化设计指令、TikTok 内容矩阵策略)、定价促销体系、供应链与客服 SOP。模块之间引用交叉、数据口径一致,方案可直接拆分为各部门执行 brief。

传送门:https://www.wenxiaobai.com/sp/18773e3d-de30-428b-ba99-a8a7a5ddf132/3N0EzVL8XQMnU9TJSkqrC
一份 21,000 字的 TCG 游戏世界观设计文档。
《星遗物:帷幕之后》是一款原创集换式卡牌游戏。问小白 5 Pro 在文件沙箱中完成了从世界观高概念、六大阵营视觉图谱、传说级卡牌 UI 设计规范到市场预热方案的全套设计文档。六大阵营角色概念图、卡面视觉层级、稀有度特效规则——所有设定跨 698 行、21,000 字始终保持一致,没有阵营混淆、视母题漂移或设定前后矛盾。

传送门:https://www.wenxiaobai.com/sp/18773e3d-de30-428b-ba99-a8a7a5ddf132/YhC7cBREyu0b4ZO4CFwYg
三个案例,三种完全不同的长程任务——调研报告、商业方案、游戏设计,问小白 5 Pro 都没有「写到一半忘了前面」,而是把每一个项目真正做完了。
从学术到产业,问小白凭什么接住“长内容生成”?
问小白 5 Pro 的长内容生成能力,背后是研发团队在 AI 长文写作评测与 Agent 架构上的长期积累。
在评测体系上,团队围绕「读大量资料、完成长期研究、保持事实一致、交付可追溯成果」这条主线,建立了一整套 benchmark:WikiLiveChallenge 评估大量引用源输入下的准确合成能力,WildGraphBench 覆盖企业级 RAG 中从单事实查询到章节级摘要的多难度任务,DeepResearch Bench / DeepResearch Bench II 评估跨多轮调研、分析与长报告撰写的综合能力。
其中,研发团队的论文《From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding》荣获 ACL 2025 Outstanding Paper Award,获奖率不到 1%。这篇论文的核心,正是带归属标注(attributed grounding)的数据合成——它直接支撑了问小白 5 Pro 最硬的那条能力:引用可追溯。

问小白研发团队论文荣获 ACL 2025 Outstanding Paper Award
论文地址https://arxiv.org/pdf/2602.01566
而在深度研究方向,团队构建的 DeepResearch Bench 已被用于与 Gemini、OpenAI、Claude 等产品同台对标。在 GTC 2026 黄仁勋主题演讲的 benchmark 对比中,DeepResearch Bench II 也出现在了相关评测画面里。

GTC 2026 主题演讲评测对比画面
对用户来说,这些研究积累最终会转化成三件你能直接感知的事:更稳的长程记忆、更可靠的引用回溯、更完整的成果交付。
问小白 5 Pro 搭建的一套大模型的工作记忆系统,引入文件沙箱和项目资产库,把我们的文档变成可以随时读取、动态回写的结构化资产,让 AI 创作彻底拥有了项目全局观。
现在,问小白 5 Pro 已在问小白App、网页端同步上线。
我们可以从这三个任务开始体验:做一份深度研究报告、续写一部长篇故事、推进一个复杂文档项目。感兴趣的朋友可以去试试。