【学习笔记】BestBlogs.dev 内容获取与筛选流程拆解:从 RSS 订阅源到个性化推荐

15 min

调研日期:2026-08-22 调研对象BestBlogs.dev(站点 + ginobefun/BestBlogs 开源仓库 + 作者的 Dify 实践文章调研动机:BestBlogs 是我见过把「AI 内容策展」公开得最彻底的产品——订阅源列表、分析流程、提示词、Workflow DSL 全部开源。之前调研过的开源资讯聚合方案大多停在「采集与呈现」,这次想看看再加上「AI 筛选与评分」之后,整条流水线到底长什么样 说明:信息来自官网 How It Works 与 About 文档、GitHub 仓库 README 与 Releases、作者的实践文章;文中数字均为调研时点数据 关联《开源资讯获取与整理方案调研》《订阅公众号文章与 X 推文的开源方案调研》——本篇可以看作这两篇的「商业成品参照系」

一、BestBlogs 是什么:AI 初评 + 专家精审的两层策展

BestBlogs.dev 定位为「AI 驱动的私人阅读助手」,口号是 Quality Content Finds the Right Reader,覆盖编程、人工智能、产品设计、商业科技、个人成长几个领域。按 About 页的口径:600+ 精选来源、10K+ AI 分析内容、3K+ 精选内容,24/7 持续更新。

它和纯聚合器(RSS 阅读器、热榜站)的根本区别在于两层策展机制

  • AI 初评:每条新内容都由 AI 自动分析,产出质量评分、摘要、标签;
  • 专家精审:编辑复核 AI 结果,修正误判,把最好的内容标成 Featured。

更难得的是透明度——它把三样东西都开源在了 GitHub 仓库里:RSS 订阅源列表(OPML)、AI 分析流程文档、Dify Workflow 的 DSL 与核心提示词。这也是这篇笔记能写得很细的原因。

二、整体流程:一条五步流水线

README「实现原理」章节给出的流水线是五步,官网 How It Works 文档则把它归纳为聚合 → AI 筛选 → 专家审核 → 简报与推荐四个阶段,两者可以合并成下面这张表:

步骤做什么关键产出
1. 内容爬取RSS 抓元数据,无头浏览器取全文标准化的待处理队列
2. 文章初评便宜的一跳判断「值不值得深析」ignore 标记 + 初步价值分
3. 深度分析GPT-4o 六环节流水线摘要、观点、金句、标签、评分
4. 多语言翻译中英互译,术语先行、意译收尾双语分析结果
5. 精审与分发专家复核 + 简报/个性化推荐Featured 精选、早报、For You

下面逐步拆解。

三、获取内容:以 RSS 为纲的订阅源工程

内容形态上覆盖五类:文章(个人博客、工程博客、官方文档、科技媒体)、播客、视频(YouTube、Bilibili)、推文(X 上的关键人物)、Newsletter,中英双语并行。所有形态进同一条处理流水线。

订阅源规模与构成(README 口径):

  • 开源 OPML 共 400 个:文章 170、播客 30、视频 40、推特 160,仓库里按类型提供分类下载,可以直接导入自己的 RSS 阅读器白嫖;
  • 团队还在按类型系统整理更多源,据仓库与作者博客的订阅源系列,已整理发布 551 个(公众号 375、播客 57、YouTube 119),陆续接入;
  • 2026 年 7 月的 v2.4.0 版本提到已完成 1600+ 优质订阅源的整合,About 页的对外口径是 600+ 精选来源。

难啃的源靠工具链解决:GitHub 无 RSS 用 RSSHub(万物皆可 RSS)、微信公众号用 wechat2rss(早期也用过 wewe-rss)、X 推文用 XGo.ing、YouTube 直接用官方 RSS。

单篇内容的抓取是四步

  1. 通过 RSS 协议爬取订阅源,拿到标题、链接、发布时间等元数据;
  2. 用无头浏览器访问文章链接,获取完整页面内容(应对动态渲染);
  3. 每个订阅源都配置了正文选择器,从页面里精准抽出正文;
  4. 对 HTML 和图片做标准化处理,进入待处理队列。

版权姿态也值得注意:站点只存元数据和 AI 生成的摘要与点评,正文阅读始终跳回原文链接,保留出处与作者。

四、第一步筛选:文章初评,一次便宜的「值不值得分析」判定

订阅源是人工挑的,但源里也会混出低质内容。如果每篇都跑深度分析,成本扛不住——所以初评的意义就是用最便宜的一跳挡掉大多数

作者在 Dify 实践文章里描述的初评流程:

  • 输入只有一个文章 ID,Workflow 里用 HTTP 节点向网站请求元数据和全文;
  • 中英文文章用不同的模型和提示词分开处理;
  • 提示词用 CO-STAR 框架(Context 背景、Objective 目标、Style 风格、Tone 语气、Audience 受众、Response 输出格式)编写,判定标准四条:语言、内容类型、主题相关度、内容质量与价值;
  • 输出结构化 JSON:ignore(是否忽略)、reason(原因)、value(0-5 价值分)、summary(一句话总结)、language(语言),网站再根据 ignore 和 value 决定这篇要不要进入深度分析。

输出大概长这样:

{
  "ignore": "no",
  "reason": "文章详细介绍了 K8s 部署过程,具有较高实用价值",
  "value": 4,
  "summary": "K8s 生产级部署的完整操作指南",
  "language": "中文"
}

How It Works 文档还提到这一层的配套检查:标题党检测、去重、翻译质量检查,都是发生在深度分析之前。

五、第二步筛选:深度分析,把一个「大提示词」拆成六个环节

这部分是整个流水线最有看头的地方。作者先讲了为什么用 Workflow:最初用一个「大而全」的提示词一次完成摘要、标签、评分、翻译,结果摘要要点遗漏、标签口径不统一、评分标准难调整、翻译生硬、模型升级运维困难。改成 Dify Workflow 后,深度分析被拆成六个环节:

  1. 分段分析:超过 6000 字符的长文先切段,逐段提取要点;
  2. 汇总分析:合并分段结果,生成一句话总结、详细摘要、关键词、主要观点(观点 + 解释)、文章金句;
  3. 领域划分和标签生成:先分领域和子类,再按统一的标签体系打标签——主题、技术、领域、应用、产品、公司、平台、名人、趋势,九类;
  4. 文章评分:按内容深度、写作质量、实用性、相关性打分(产品层面对外展示为 0-100 的质量分);
  5. 检查反思:让 LLM 扮演评审专家,按全面性、准确性、一致性三个标准检查前面的所有输出;
  6. 优化改进:依据反思结果修订,输出最终结果并附更新原因。

两个设计值得单独强调:

  • 「检查反思 → 优化改进」是流水线的内生环节,不是可选步骤——生成式任务的质检闭环直接写进了 Workflow;
  • 标签体系是预定义的,模型只能从中选择,这从机制上解决了「标签口径不统一」的问题。

成本参考:据作者文章给出的示例数据,初评 + 深度分析 + 翻译三个流程跑完一篇约 157 秒、2.9 万 tokens(GPT-4o 时期)——这也是为什么初评过滤如此重要。

六、翻译:术语先行,意译收尾

翻译的输入是元数据、全文和分析结果三者,输出的则是分析结果(摘要、观点、金句、标签、标题)的中英双语版本,而不是翻译全文。流程三段式:

  1. 识别专业术语并初次翻译:先抽出术语表,带着术语约束做初译,避免技术名词被硬翻;
  2. 检查翻译:检查准确性、一致性、流畅性、专业性;
  3. 意译优化:在准确的基础上按目标语言习惯重写,消除翻译腔。

2026 年 3 月的 v2.3.0 版本还对翻译提示词做过专门更新,并加了「智能标题翻译」——标题这种最显眼的位置单独优化。

七、专家精审与分发:AI 管量,专家管质

How It Works 文档对「为什么要两层」的解释很坦诚:

  • AI 有系统性盲点——会给包装精美的标题党打高分,会低估小众但深度的内容;
  • 纯人工又不可扩展——每天有数千条新内容进来。

所以分工是 AI 处理量(滤噪),专家处理质(选优)。专家审核做四件事:复核 AI 结果并修正误判、过滤标题党和内容农场、给最佳条目标 Featured 徽章、撰写双语推荐理由(「为什么推荐这篇」)。

过了两道关卡的内容进入精选池,再分发到不同出口:

出口形式节奏
Explore全量精选池,按分类、类型、分数、语言筛选常驻
Public Brief站级每日简报周一至周六
Curated Newsletter每周主题精选邮件每周五
My Brief围绕个人兴趣与关注来源重排的早报(Pro)每日
For You基于六维兴趣画像的个性化信息流常驻

简报类任务同样由 Dify Workflow 编排生成。

八、评分体系是迭代出来的

把仓库 Releases 的更新记录串起来看,会发现评分体系不是一次设计定型的,而是当产品一样持续迭代

时间版本评分与分析相关变更
2024-07Dify Workflow 实践落地,初评、分析、翻译三流程
2025-04v2.0.0整体重构为 Dify Workflow 实现
2025-06v2.1.0通义听悟播客智能分析上线
2025-08v2.2.0My Digest 每日早报
2026-03v2.3.0六维评分(选题、内容、深度、实用、创新、表达)、金句摘录、代码块检测、AI 内容占比评估、翻译提示词更新
2026-07v2.4.0评分体系按主题维度重构、精选内容体系、订阅源整合 1600+、升级 GPT-5.2

最新动作(Newsletter #87)是用 AI Skills 对评分体系做 review 和微调,把反复出现的判断规则沉淀回提示词。How It Works 文档中对外描述的「0-100 分、技术深度、信息价值、可读性、实用指导四维」是面向用户的简化口径,内部维度已经演进过好几轮。

九、播客、推文、视频:同一流水线的变体

  • 播客:先用通义听悟做语音转写(全文转写、说话人分离、章节速览),再把转写文本送进同一套 Dify 分析流程,产出摘要、观点、金句、评分;
  • 推文:XGo.ing 采集后走 Dify Workflow 分析,重点是提取值得读的推文串而不是单条碎念;
  • 视频:README 标注方案开发中,视频源(YouTube、Bilibili)已通过 RSS 采集进系统。

十、对照自建 DailyDigest 流水线:值得偷的五招

  1. 源头策展优先于算法过滤。400 个 OPML 源是人工挑的,算法只需要在好源里排序,而不是在垃圾堆里捞金。给 DailyDigest 扩源时,先审源再加源。
  2. 两级漏斗控成本。便宜初评挡掉大头,昂贵的深度分析只留给过筛内容——这个结构对任何「全量 AI 处理」的流水线都成立。
  3. 生成任务要带「检查反思 → 优化改进」闭环。让模型先自查全面性、准确性、一致性,再按反思结果修订,比一次生成直接用的质量稳定得多。
  4. 提示词运维化。把大提示词拆成子流程后,单独调、单独换模型、单独回滚,日志还能定位到具体环节——这和代码拆模块是同一个道理。
  5. 评分体系当产品迭代并公开变更。从四维到六维再到主题维度,每次重构都写进 Releases。自建流水线的打分规则同样该有版本记录,否则调过就忘。

参考资料