【学习笔记】BestBlogs.dev 内容获取与筛选流程拆解:从 RSS 订阅源到个性化推荐
调研日期:2026-08-22 调研对象:BestBlogs.dev(站点 + ginobefun/BestBlogs 开源仓库 + 作者的 Dify 实践文章) 调研动机:BestBlogs 是我见过把「AI 内容策展」公开得最彻底的产品——订阅源列表、分析流程、提示词、Workflow DSL 全部开源。之前调研过的开源资讯聚合方案大多停在「采集与呈现」,这次想看看再加上「AI 筛选与评分」之后,整条流水线到底长什么样 说明:信息来自官网 How It Works 与 About 文档、GitHub 仓库 README 与 Releases、作者的实践文章;文中数字均为调研时点数据 关联:《开源资讯获取与整理方案调研》、《订阅公众号文章与 X 推文的开源方案调研》——本篇可以看作这两篇的「商业成品参照系」
一、BestBlogs 是什么:AI 初评 + 专家精审的两层策展
BestBlogs.dev 定位为「AI 驱动的私人阅读助手」,口号是 Quality Content Finds the Right Reader,覆盖编程、人工智能、产品设计、商业科技、个人成长几个领域。按 About 页的口径:600+ 精选来源、10K+ AI 分析内容、3K+ 精选内容,24/7 持续更新。
它和纯聚合器(RSS 阅读器、热榜站)的根本区别在于两层策展机制:
- AI 初评:每条新内容都由 AI 自动分析,产出质量评分、摘要、标签;
- 专家精审:编辑复核 AI 结果,修正误判,把最好的内容标成 Featured。
更难得的是透明度——它把三样东西都开源在了 GitHub 仓库里:RSS 订阅源列表(OPML)、AI 分析流程文档、Dify Workflow 的 DSL 与核心提示词。这也是这篇笔记能写得很细的原因。
二、整体流程:一条五步流水线
README「实现原理」章节给出的流水线是五步,官网 How It Works 文档则把它归纳为聚合 → AI 筛选 → 专家审核 → 简报与推荐四个阶段,两者可以合并成下面这张表:
| 步骤 | 做什么 | 关键产出 |
|---|---|---|
| 1. 内容爬取 | RSS 抓元数据,无头浏览器取全文 | 标准化的待处理队列 |
| 2. 文章初评 | 便宜的一跳判断「值不值得深析」 | ignore 标记 + 初步价值分 |
| 3. 深度分析 | GPT-4o 六环节流水线 | 摘要、观点、金句、标签、评分 |
| 4. 多语言翻译 | 中英互译,术语先行、意译收尾 | 双语分析结果 |
| 5. 精审与分发 | 专家复核 + 简报/个性化推荐 | Featured 精选、早报、For You |
下面逐步拆解。
三、获取内容:以 RSS 为纲的订阅源工程
内容形态上覆盖五类:文章(个人博客、工程博客、官方文档、科技媒体)、播客、视频(YouTube、Bilibili)、推文(X 上的关键人物)、Newsletter,中英双语并行。所有形态进同一条处理流水线。
订阅源规模与构成(README 口径):
- 开源 OPML 共 400 个:文章 170、播客 30、视频 40、推特 160,仓库里按类型提供分类下载,可以直接导入自己的 RSS 阅读器白嫖;
- 团队还在按类型系统整理更多源,据仓库与作者博客的订阅源系列,已整理发布 551 个(公众号 375、播客 57、YouTube 119),陆续接入;
- 2026 年 7 月的 v2.4.0 版本提到已完成 1600+ 优质订阅源的整合,About 页的对外口径是 600+ 精选来源。
难啃的源靠工具链解决:GitHub 无 RSS 用 RSSHub(万物皆可 RSS)、微信公众号用 wechat2rss(早期也用过 wewe-rss)、X 推文用 XGo.ing、YouTube 直接用官方 RSS。
单篇内容的抓取是四步:
- 通过 RSS 协议爬取订阅源,拿到标题、链接、发布时间等元数据;
- 用无头浏览器访问文章链接,获取完整页面内容(应对动态渲染);
- 每个订阅源都配置了正文选择器,从页面里精准抽出正文;
- 对 HTML 和图片做标准化处理,进入待处理队列。
版权姿态也值得注意:站点只存元数据和 AI 生成的摘要与点评,正文阅读始终跳回原文链接,保留出处与作者。
四、第一步筛选:文章初评,一次便宜的「值不值得分析」判定
订阅源是人工挑的,但源里也会混出低质内容。如果每篇都跑深度分析,成本扛不住——所以初评的意义就是用最便宜的一跳挡掉大多数。
作者在 Dify 实践文章里描述的初评流程:
- 输入只有一个文章 ID,Workflow 里用 HTTP 节点向网站请求元数据和全文;
- 中英文文章用不同的模型和提示词分开处理;
- 提示词用 CO-STAR 框架(Context 背景、Objective 目标、Style 风格、Tone 语气、Audience 受众、Response 输出格式)编写,判定标准四条:语言、内容类型、主题相关度、内容质量与价值;
- 输出结构化 JSON:
ignore(是否忽略)、reason(原因)、value(0-5 价值分)、summary(一句话总结)、language(语言),网站再根据 ignore 和 value 决定这篇要不要进入深度分析。
输出大概长这样:
{
"ignore": "no",
"reason": "文章详细介绍了 K8s 部署过程,具有较高实用价值",
"value": 4,
"summary": "K8s 生产级部署的完整操作指南",
"language": "中文"
}How It Works 文档还提到这一层的配套检查:标题党检测、去重、翻译质量检查,都是发生在深度分析之前。
五、第二步筛选:深度分析,把一个「大提示词」拆成六个环节
这部分是整个流水线最有看头的地方。作者先讲了为什么用 Workflow:最初用一个「大而全」的提示词一次完成摘要、标签、评分、翻译,结果摘要要点遗漏、标签口径不统一、评分标准难调整、翻译生硬、模型升级运维困难。改成 Dify Workflow 后,深度分析被拆成六个环节:
- 分段分析:超过 6000 字符的长文先切段,逐段提取要点;
- 汇总分析:合并分段结果,生成一句话总结、详细摘要、关键词、主要观点(观点 + 解释)、文章金句;
- 领域划分和标签生成:先分领域和子类,再按统一的标签体系打标签——主题、技术、领域、应用、产品、公司、平台、名人、趋势,九类;
- 文章评分:按内容深度、写作质量、实用性、相关性打分(产品层面对外展示为 0-100 的质量分);
- 检查反思:让 LLM 扮演评审专家,按全面性、准确性、一致性三个标准检查前面的所有输出;
- 优化改进:依据反思结果修订,输出最终结果并附更新原因。
两个设计值得单独强调:
- 「检查反思 → 优化改进」是流水线的内生环节,不是可选步骤——生成式任务的质检闭环直接写进了 Workflow;
- 标签体系是预定义的,模型只能从中选择,这从机制上解决了「标签口径不统一」的问题。
成本参考:据作者文章给出的示例数据,初评 + 深度分析 + 翻译三个流程跑完一篇约 157 秒、2.9 万 tokens(GPT-4o 时期)——这也是为什么初评过滤如此重要。
六、翻译:术语先行,意译收尾
翻译的输入是元数据、全文和分析结果三者,输出的则是分析结果(摘要、观点、金句、标签、标题)的中英双语版本,而不是翻译全文。流程三段式:
- 识别专业术语并初次翻译:先抽出术语表,带着术语约束做初译,避免技术名词被硬翻;
- 检查翻译:检查准确性、一致性、流畅性、专业性;
- 意译优化:在准确的基础上按目标语言习惯重写,消除翻译腔。
2026 年 3 月的 v2.3.0 版本还对翻译提示词做过专门更新,并加了「智能标题翻译」——标题这种最显眼的位置单独优化。
七、专家精审与分发:AI 管量,专家管质
How It Works 文档对「为什么要两层」的解释很坦诚:
- AI 有系统性盲点——会给包装精美的标题党打高分,会低估小众但深度的内容;
- 纯人工又不可扩展——每天有数千条新内容进来。
所以分工是 AI 处理量(滤噪),专家处理质(选优)。专家审核做四件事:复核 AI 结果并修正误判、过滤标题党和内容农场、给最佳条目标 Featured 徽章、撰写双语推荐理由(「为什么推荐这篇」)。
过了两道关卡的内容进入精选池,再分发到不同出口:
| 出口 | 形式 | 节奏 |
|---|---|---|
| Explore | 全量精选池,按分类、类型、分数、语言筛选 | 常驻 |
| Public Brief | 站级每日简报 | 周一至周六 |
| Curated Newsletter | 每周主题精选邮件 | 每周五 |
| My Brief | 围绕个人兴趣与关注来源重排的早报(Pro) | 每日 |
| For You | 基于六维兴趣画像的个性化信息流 | 常驻 |
简报类任务同样由 Dify Workflow 编排生成。
八、评分体系是迭代出来的
把仓库 Releases 的更新记录串起来看,会发现评分体系不是一次设计定型的,而是当产品一样持续迭代:
| 时间 | 版本 | 评分与分析相关变更 |
|---|---|---|
| 2024-07 | — | Dify Workflow 实践落地,初评、分析、翻译三流程 |
| 2025-04 | v2.0.0 | 整体重构为 Dify Workflow 实现 |
| 2025-06 | v2.1.0 | 通义听悟播客智能分析上线 |
| 2025-08 | v2.2.0 | My Digest 每日早报 |
| 2026-03 | v2.3.0 | 六维评分(选题、内容、深度、实用、创新、表达)、金句摘录、代码块检测、AI 内容占比评估、翻译提示词更新 |
| 2026-07 | v2.4.0 | 评分体系按主题维度重构、精选内容体系、订阅源整合 1600+、升级 GPT-5.2 |
最新动作(Newsletter #87)是用 AI Skills 对评分体系做 review 和微调,把反复出现的判断规则沉淀回提示词。How It Works 文档中对外描述的「0-100 分、技术深度、信息价值、可读性、实用指导四维」是面向用户的简化口径,内部维度已经演进过好几轮。
九、播客、推文、视频:同一流水线的变体
- 播客:先用通义听悟做语音转写(全文转写、说话人分离、章节速览),再把转写文本送进同一套 Dify 分析流程,产出摘要、观点、金句、评分;
- 推文:XGo.ing 采集后走 Dify Workflow 分析,重点是提取值得读的推文串而不是单条碎念;
- 视频:README 标注方案开发中,视频源(YouTube、Bilibili)已通过 RSS 采集进系统。
十、对照自建 DailyDigest 流水线:值得偷的五招
- 源头策展优先于算法过滤。400 个 OPML 源是人工挑的,算法只需要在好源里排序,而不是在垃圾堆里捞金。给 DailyDigest 扩源时,先审源再加源。
- 两级漏斗控成本。便宜初评挡掉大头,昂贵的深度分析只留给过筛内容——这个结构对任何「全量 AI 处理」的流水线都成立。
- 生成任务要带「检查反思 → 优化改进」闭环。让模型先自查全面性、准确性、一致性,再按反思结果修订,比一次生成直接用的质量稳定得多。
- 提示词运维化。把大提示词拆成子流程后,单独调、单独换模型、单独回滚,日志还能定位到具体环节——这和代码拆模块是同一个道理。
- 评分体系当产品迭代并公开变更。从四维到六维再到主题维度,每次重构都写进 Releases。自建流水线的打分规则同样该有版本记录,否则调过就忘。