本文由 莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
你刷短视频的时候有没有这种感觉——明明自己兴趣挺广泛的,但刷来刷去永远是那几样内容?这不是你的问题,是推荐算法的底层设计决定了它只会越推越窄。协同过滤、内容推荐这些经典方案本质上都在做同一件事:根据你"已经看过什么"来推"你还会看什么"。结果就是每个人都被关进了自己的信息茧房,而且在不同平台(B站、小红书、抖音、知乎)你被切割成了互不相干的几份。
OpenBiliClaw 这个开源项目做了一个完全反直觉的设计:它不分析你"看过什么",而是先分析你"是什么样的人"——通过五层心理画像建模(事件→偏好→觉察→洞察→灵魂),构建你的完整人格素描,再跨平台去 B站、小红书、抖音、知乎等七大平台主动搜索你真正可能感兴趣的内容。所有数据 100% 留在本地 SQLite 文件里,不经过任何云端。我在自己的设备上完整跑了一遍,从安装到调教到日常使用,确实有不少惊喜,也有一些需要理性看待的地方。本文会从推荐算法原理、信息茧房的成因、OpenBiliClaw 的技术架构、五层画像模型、跨平台整合机制,到完整的上手步骤和实测体验,把这件事彻底说清楚。
想看完整拆解,往下翻。
一、信息茧房:我们都是被算法"温柔囚禁"的人
先讲一个我自己亲历的小事。
去年有段时间我想换键盘,在 B 站搜了几天机械键盘的评测视频,翻来覆去看了轴体对比、套件拆解、键帽搭配。键盘买完之后,这事就翻篇了。问题是——到现在,B 站首页偶尔还会给我推"2025 年性价比机械键盘推荐""铝坨坨套件横评"这类视频。我早就对键盘没兴趣了,但算法还在执着地把我当成一个"键盘爱好者"。
这不是 B 站独有的问题。刷抖音也是,看过几条猫咪视频,接下来三天首页全是猫。小红书收藏了几篇咖啡器具的笔记,之后推荐流里就再也看不到茶叶相关的内容了——尽管我喝茶的频率其实比喝咖啡高得多。
用学术一点的话说,这就是信息茧房(Information Cocoons)。
这个词最早由哈佛大学法学院教授凯斯·桑斯坦在 2006 年提出,描述的是一个人在信息传播中被海量同质化内容包裹,逐渐丧失接触多元信息的能力。放到今天的互联网语境里,就是那句话——"你以为你在刷世界,其实算法在刷你。"
信息茧房到底有多普遍?2025 年 5 月,央视网专门做了一期报道,采访了不少普通网民。有个高校老师说得特别直白:"刷手机的时候能感觉到确实存在这样的'茧房',越看越窄,大数据算法会根据你这个人的性格看人下菜碟,想跳出来都难。"还有个受访者说:"如果你自己没有辨别能力,你就永远只看得到它认为你想看的东西。"
不只是个体感受,政策层面也开始重视了。2024 年 11 月到 2025 年 2 月,国家市场监管总局和公安部联合开展了"清朗·网络平台算法典型问题治理"专项行动,把"深入整治信息茧房、诱导沉迷问题"列为头号任务。中国计算机学会(CCF)在 2025 年 1 月专门组织了一场"解码信息茧房:困境与突破之道"的学术论坛,几十位高校专家和科技工作者坐下来讨论这个事。
论坛的结论挺耐人寻味的:信息茧房不是某一个坏人故意搞出来的,它是推荐算法、用户主观选择、平台商业利益、内容生态机制共同作用的产物。
什么意思呢?算法当然有锅——它被设计成以"最大化用户停留时长"为目标,自然会倾向于给你推那些已经被验证过"你会点进去看"的内容。但用户自己也不是完全无辜——人天生就有"确认偏误",喜欢看自己认同的东西,不自觉地避开让自己不舒服的信息。平台方面就更不用说了,广告收入直接跟用户时长挂钩,谁会和钱过不去?
所以这事从根上说,是一个系统性问题。而系统性问题,就需要系统性的解法。
当前各大主流平台,不管是抖音、B站、小红书还是快手,都在尝试提供一些"破茧"工具。比如抖音的"内容偏好评估"功能,小红书的"探索更多",快手的"正能量算法"。这些当然是有意义的尝试,但有一个根本矛盾绕不过去:平台推荐系统优化的是平台的目标(完播率、留存时间、广告收入),用户满意只是留存的手段而已。
只要推荐算法的优化目标还是"让你多看一会儿",那信息茧房就只是一个程度问题,而不是有无问题。
这也就是为什么,我对 OpenBiliClaw 这个项目产生了强烈的兴趣——它不是在平台内部修修补补,而是直接换了一套底层逻辑。
二、推荐算法的底层逻辑:协同过滤为什么越推越窄
要理解 OpenBiliClaw 为什么特别,得先搞明白传统推荐系统到底是怎么工作的。这里我不打算写成教科书,但几个核心概念绕不过去,我尽量用白话说。
主流推荐算法三兄弟
目前市面上几乎所有内容平台的推荐系统,跑的都离不开这三种基本范式:
|
算法类型 |
核心思路 |
一句话概括 |
代表场景 |
|
协同过滤(Collaborative Filtering) |
"跟你相似的人看过什么" |
人以群分 |
B站首页推荐、抖音 For You |
|
基于内容的推荐(Content-Based) |
"这个内容跟你以前看过的东西像不像" |
物以类聚 |
小红书相似笔记、知乎相关文章 |
|
混合推荐(Hybrid) |
上面两种一起用,再加点规则 |
双管齐下 |
几乎所有主流平台的实际方案 |
下面重点拆协同过滤,因为它是信息茧房的主要"功臣"。
协同过滤的本质:你就走在别人走过的路上
协同过滤的核心数据结构是一个用户-物品评分矩阵。你可以想象成一张巨大的 Excel 表:
- 每一行是一个用户
- 每一列是一个内容(视频、文章、商品)
- 每个格子里是这个用户跟这个内容的交互数据(看了多久、点赞没、收藏没、评论没)
算法在这个矩阵里做的事很简单:找相似。要么找"和你相似的用户"(User-based CF),要么找"和你喜欢过的内容相似的内容"(Item-based CF)。
打个比方:用户 A 看了视频 X、Y、Z,用户 B 看了视频 X、Y、W。算法发现 A 和 B 在 X 和 Y 上有重叠,就猜 B 可能也喜欢 Z,于是把 Z 推给 B。反过来也一样,A 可能收到 W 的推荐。
这就是协同过滤——你的推荐列表,本质上是"跟你相似的人走过的路"的全集。
听起来挺合理的对吧?但问题就出在这里。
协同过滤的三个致命盲区
第一,它只能推"已知的已知"。 协同过滤的逻辑链条是:你看了 A → 同样看了 A 的人还看了 B → 所以推 B 给你。这条链条从来不会导向一个"没有任何跟你相似的人看过的内容"。换句话说,它永远不会主动猜测你可能喜欢但从未接触过的领域。
你在 B 站看了三年机械键盘,看到键盘视频就点进去——协同过滤一看,好家伙,键盘内容点击率真高,再多推几条!于是你的 B 站首页就被键盘攻陷了。它不会想"这个人可能也对客制化 PC 装机感兴趣",因为没有和你相似的人在键盘和装机之间架过桥。
第二,冷启动和稀疏性问题。 新用户刚注册,矩阵里一行都是空的——没数据,啥也推不了。新内容刚发布,矩阵里一列都是空的——没人看过,也推不出去。虽然平台有各种工程手段缓解(比如热度加权、随机探索),但本质上协同过滤就是一个"吃历史数据"的模型,越吃越窄。
第三,马太效应。 头部内容因为曝光多→互动多→被推荐更多→曝光更多。尾部内容翻不了身。这不仅是公平性问题,对用户来说意味着你的推荐流里越来越多的"大家都知道的热门内容",越来越少的那种"冷门但精准契合你"的小众内容。
IBM 在一篇关于协同过滤的科普文章里总结得很好:协同过滤和基于内容的推荐各有盲点,这就是为什么 Netflix 早在 2009 年就用了混合方案。但即便是混合方案,也没有跳出"根据你的历史行为来预测未来兴趣"这个基本框架。
而信息茧房,就是这个框架的必然副产品。
一张图看清协同过滤怎么把人"圈"起来的
下面用一个非常简单直接的流程图来描述这个过程:
graph TD
A["你刷到一条内容"] --> B{"点进去了吗?"}
B -->|点了| C["系统标记:你对这类内容感兴趣"]
B -->|没点| D["系统标记:你对这类内容不感兴趣"]
C --> E["推送更多同类内容"]
E --> F["你的信息流中该类内容占比提升"]
F --> G["你更频繁地点击该类内容"]
G --> C
D --> H["降低该类内容权重"]
H --> I["你的信息流越来越集中在少数几个品类"]
I --> J["信息茧房形成"]
G --> J
这个循环一旦跑起来,就很难自己停下来。算法越推→你越看→算法越认为你喜欢→越推。而且注意,这里说的"你喜欢"不等于"你真的喜欢",它只是"你点了"。很多人刷短视频的时候都有过这种体验:点进去一条并不想看的东西,纯粹因为封面骗了或者手滑,然后接下来首页就变味了。算法不关心你的"真实意愿",它只关心"行为信号"。
这就引出了一个非常重要但经常被忽视的问题:算法看到的是你的行为,不是你的人。
三、各大平台的推荐机制差异:同一个你,被切成了好几份
在深入 OpenBiliClaw 之前,还有一个痛点必须说清楚——跨平台的数据孤岛效应。
大多数人不会只用一个平台。我自己就是:在 B 站看科技评测和知识科普,在小红书收藏家居改造和咖啡器具,在抖音偶尔看看纪录片和搞笑视频,在知乎搜技术问题。这四个平台各自有我的使用数据,但它们之间零交流。
B 站不知道我小红书里收藏了一堆意式咖啡机的笔记——如果知道的话,它可能会给我推"程序员必备的家庭咖啡角搭建指南",而我真的会想看。但协同过滤不会跨平台运作,因为数据不互通。
反过来也一样。知乎不知道我在 B 站上追了好几个量子物理的科普 UP 主,所以它不会在首页给我推"量子纠缠与哲学自由意志"的讨论——而这恰恰是我在知乎上最想看的东西。
这事比"信息茧房"还惨。信息茧房好歹还是一个笼子,跨平台孤岛直接把你切成好几块,每块关在不同的笼子里。
四大主流平台推荐机制速览
不同平台的推荐策略差异很大,理解这些差异有助于你明白为什么需要一个跨平台工具。
|
维度 |
B站 |
小红书 |
抖音 |
知乎 |
|
推荐逻辑核心 |
社区互动权重高,重视硬币/收藏/弹幕 |
搜索+推荐双驱动,工具属性强 |
完播率+互动率,极度依赖实时反馈 |
话题权重+专业度+社交关系链 |
|
冷启动策略 |
分区推荐+编辑精选+热门加权 |
主动搜索行为占比高,新手友好 |
初始流量池+赛马机制 |
话题关注+领域匹配 |
|
用户画像颗粒度 |
分区标签+UP主偏好 |
生活方式标签+消费力分层 |
极细颗粒行为标签+实时兴趣 |
话题关注+专业领域+阅读深度 |
|
破茧能力 |
较弱,但有"不感兴趣"反馈 |
中,有"内容偏好调节" |
中,有"使用管理助手" |
较弱,依赖主动搜索 |
|
内容跨领域推荐 |
少见,依赖UP主跨界 |
常见(搜索驱动的自然探索) |
较少,算法趋向收敛 |
常见(话题网络自然关联) |
这个表是我根据自己长期使用和阅读各平台公开的算法说明归纳的,不是精确的技术文档,但大方向没问题。要注意一点:每个平台的算法都在持续迭代中,上述特征只是写稿时的近似情况。
为什么跨平台孤岛比信息茧房更可怕
信息茧房让你在一个平台上越看越窄。跨平台孤岛让你在不同的平台上看到的世界完全不重叠。你在 B 站是一个"科技数码爱好者",在小红书是一个"精致生活博主预备役",在知乎是一个"严肃的哲学和计算机讨论者"——这些身份在同一个人身上完全可以共存,但在算法眼里它们是三个完全不相关的人。
这带来的后果是,没有一个平台能给你推荐"综合了你完整人格"的内容。你的人格被平台切割成了碎片,散落在不同的数据孤岛上。
用一个更生活化的比喻:就好像你有三个好朋友,一个只了解你的工作状态,一个只了解你的周末爱好,一个只了解你的深夜思考。他们各自给你推荐东西,但没有人真正了解完整的你。
这就是 OpenBiliClaw 想要解决的第二层问题——不只是破茧,还要把人重新拼起来。
四、OpenBiliClaw 是什么:把推荐逻辑反过来
终于到主角了。
OpenBiliClaw 是一个本地运行、完全开源(MIT 协议)的跨平台内容发现 AI Agent。项目地址在 GitHub 上,由开发者 whiteguo233 维护。我写这篇文章的时候,它在 GitHub 上有超过 1100 个 star,社区活跃度相当不错。
它和传统推荐系统最根本的区别,用一句话就能概括:
传统推荐系统:根据你"看过什么"来推"你还会看什么"。
OpenBiliClaw:先分析你"是什么样的人",再根据这个画像去主动搜索你可能喜欢的内容。
这个顺序的颠倒,是整个系统设计哲学的核心。
它和传统推荐系统到底哪里不一样
传统推荐(不管是协同过滤还是内容推荐)的工作流大致是这样的:
- 收集你的行为数据(看了什么、点了什么、收藏了什么)
- 在已有的内容池里找和这些数据"相似"的其他内容
- 推给你
OpenBiliClaw 的工作流是反过来的:
- 收集你的跨平台行为数据(你在 B站、小红书、抖音甚至知乎等平台上的行为。需要说明的是,其中涉及的境外内容平台如 YouTube 等,使用时应遵守国内网络与内容管理相关规定,OpenBiliClaw 本身仅做内容发现,不提供网络访问服务)
- 先不急着找内容,而是用这些数据构建你的"人格画像"
- 用这个画像去多个平台主动搜索你可能会喜欢的内容
- 推给你,并附带"为什么推荐这个"的解释
两个关键创新点:
第一,从"被动推荐"变成"主动搜索"。 传统推荐系统是被动等待内容进入候选池,然后打分排序。OpenBiliClaw 是拿着你的画像主动去平台上找——这个动作本身就打破了"只能看到平台想让你看到的内容"的局限。
第二,从"行为拟合"变成"人格建模"。 你点了一个视频,传统算法的理解是"用户喜欢这类视频"。OpenBiliClaw 的理解是"这个行为反映了用户的某种深层倾向,可能指向一系列跨领域的兴趣"。这是一个从"标签级理解"到"人格级理解"的跃升。
技术架构概览
OpenBiliClaw 由两部分组成:一个浏览器插件和一个本地后端程序。
┌─────────────────────────────────────────────┐
│ 你的浏览器 │
│ ┌──────────────────────────────────┐ │
│ │ Chrome 插件(采集+反馈+侧边栏) │ │
│ │ - 在各平台页面注入侧边栏 │ │
│ │ - 采集你的浏览/互动行为 │ │
│ │ - 安全传递登录态给后端 │ │
│ └──────────────┬───────────────────┘ │
│ │ 本地通信 (127.0.0.1) │
└─────────────────┼────────────────────────────┘
│
┌─────────────────┼────────────────────────────┐
│ 你的电脑(本地后端) │
│ ┌──────────────┴───────────────────┐ │
│ │ Python 后端服务 │ │
│ │ - 接收浏览器传来的行为数据 │ │
│ │ - 调用 LLM 构建心理画像 │ │
│ │ - 跨平台搜索候选内容 │ │
│ │ - 生成推荐并解释理由 │ │
│ └──────────────┬───────────────────┘ │
│ │ │
│ ┌──────────────┴───────────────────┐ │
│ │ 本地 SQLite 数据库 │ │
│ │ - 所有数据 100% 留在本地 │ │
│ │ - 可随时导出/修改/删除 │ │
│ └──────────────────────────────────┘ │
│ │ │
│ ┌──────────────┴───────────────────┐ │
│ │ LLM(你自己的 API Key) │ │
│ │ - DeepSeek / OpenAI / Ollama │ │
│ │ - 用于画像推理和推荐理由生成 │ │
│ └──────────────────────────────────┘ │
└──────────────────────────────────────────────┘
几个值得注意的设计细节:
- 100% 本地数据存储:你的所有行为数据、画像数据、偏好数据都存在本机的一个 SQLite 文件里,没有任何云端同步。后端程序关了,谁也别想访问。
- LLM 用自己的 Key:你需要自己准备一个大模型的 API Key(推荐 DeepSeek,性价比高;也可以用本地的 Ollama 完全离线跑)。每次推荐会消耗少量 token,费用很低但毕竟不是零成本。
- 跨平台靠浏览器插件:插件不只是采集数据,还负责在 B站/小红书/抖音等页面注入一个侧边栏,让你在刷平台的同时就能给 OpenBiliClaw 反馈。
这个东西的定位很清楚:它不是一个"更好的抖音推荐算法",它是一个完全独立于任何平台的、为你个人服务的推荐 Agent。
五、五层心理画像:从"你看了什么"到"你是什么样的人"
这是 OpenBiliClaw 整个系统里我最感兴趣的部分,也是最体现它和传统推荐算法差异的地方。
先看一张总览表,然后我们一层一层拆:
|
层级 |
名称 |
问题 |
输入 |
输出 |
举例 |
|
L1 |
事件层 |
"你做了什么" |
原始行为数据(点击、观看时长、点赞、收藏) |
结构化行为日志 |
看了3条键盘评测,平均观看时长8分钟 |
|
L2 |
偏好层 |
"你喜欢什么" |
L1 的行为数据 |
内容口味偏好标签 |
数码硬件、深度横评、UP主风格偏好 |
|
L3 |
觉察层 |
"你怎么思考" |
L2 的偏好模式 |
认知风格、信息处理方式 |
喜欢系统化对比、重视数据、偏好长内容 |
|
L4 |
洞察层 |
"你是什么样的人" |
L3 的认知模式 |
MBTI 推测、核心特质、深层需求 |
INTP、分析型思维、渴望"理解事物运作原理" |
|
L5 |
灵魂层 |
"你是谁" |
L1-L4 的全部信息 |
整体人格素描 |
"一个喜欢深入探究事物本质、对技术原理有好奇心、偏好结构化知识的人" |
这五层是怎么从行为数据一步步推出来的?下面拆开讲。
L1 事件层:把原始行为变成结构化日志
这是最底层,做的事最"朴实":把你在各个平台上的操作——看了什么视频、点了什么按钮、在哪个页面停留了多久——全部记录下来,转成结构化的行为日志。
这里没什么 AI 的成分,更多是数据采集和清洗。但有一个关键点:它不只记录"你点了什么",还记录"你是怎么点的"。 比如:你是完整看完了一个 20 分钟的视频,还是看了 30 秒就划走了?你是认真收藏了,还是只是点赞一下?这些行为细节在后续的画像构建中都是关键信号。
行为日志示例(脱敏后):
[2025-06-15 14:32] B站 - 观看视频《机械键盘轴体横评》 - 完整观看(18min) - 收藏
[2025-06-15 14:50] B站 - 浏览UP主主页 - 查看往期视频列表 - 点击3条
[2025-06-15 19:20] 小红书 - 搜索"意式咖啡机 入门" - 浏览笔记6篇 - 收藏2篇
[2025-06-16 09:10] 知乎 - 阅读文章《量子力学的哲学基础》 - 完整阅读 - 未互动
L2 偏好层:从行为中归纳口味
有了 L1 的结构化日志,系统开始归纳模式。这里用的是比较成熟的 NLP 文本分析和标签聚类技术。
比如,你看了很多数码产品评测,系统不会只给你打一个"数码"标签,而是会进一步细分:是不是偏硬件(轴体、芯片、屏幕参数)还是偏体验(使用感受、购买建议)?是不是偏爱深度内容(30 分钟以上的横评)还是短平快(5 分钟以内的精炼版)?
这一步做的是传统的"用户画像"工作,但它的粒度比大多数平台要细——因为它是跨平台的,能看到更完整的行为拼图。
L3 觉察层:推测你的认知风格
这一层开始有 AI 推理的介入。系统把 L2 的偏好模式喂给大模型,让模型去分析你的认知风格。
什么叫认知风格?就是你处理信息的方式。比如:
- 你是喜欢"先看结论再决定要不要深入"(结论驱动型),还是喜欢"从头到尾跟着推导过程走"(过程驱动型)?
- 你喜欢系统化的知识结构(比如完整的课程或系列视频),还是碎片化的灵感刺激(比如单个有趣的短视频)?
- 你更看重数据和分析,还是更看重故事和感受?
这些认知风格不是直接能从"你看了什么"里看出来的,需要模型根据你的行为模式进行推断。举个例子:如果你在 B 站上经常把进度条拖到视频后半段先看结论,再决定要不要从头看,系统可能会判断你是"结论驱动型"——这个推断对于后续的推荐策略非常关键。
L4 洞察层:MBTI 推测与深层需求
这一层是很多人觉得"可怕"的地方——系统会尝试推测你的 MBTI 人格类型。
说实话,MBTI 在心理学界争议不小,很多专家认为它缺乏足够的实证支撑。但作为一个粗略的人格倾向参考框架,它在内容推荐这个场景里确实有实用价值。INTP 和 ESFJ 想看的东西大概率不一样,这不是刻板印象,是统计规律。
除了 MBTI,这一层还会识别你的核心特质和深层需求。比如:
- 核心特质可能是"好奇心强""喜欢系统性""对技术原理有探索欲"
- 深层需求可能是"理解事物为什么这样运作""获取能直接用的实用知识"
这些东西不是从你的某个行为里直接读出来的,而是 L1 到 L3 层层累积之后,由大模型综合推理出来的"最佳猜测"。
L5 灵魂层:完整的"人格素描"
最顶层是一个整体的、叙事性的描述。它不是标签的堆砌,而是一段连贯的文字,描述"你是一个什么样的人"。
我自己的画像跑出来大概是这样的(脱敏处理后):
"一个对技术原理有强烈好奇心的人,喜欢系统化地理解事物而非停留在表面。偏好深度内容,重视逻辑和数据支撑。在消费决策上有研究型倾向(购买前会做大量调研),对美学和设计有一定敏感度。偶尔也会需要轻松的娱乐内容放松,但整体信息消费以'获取知识'为主要驱动力。"
说实话,这段描述确实精准。它不是从某一个平台的行为里分析出来的,而是综合了我在 B站(科技内容为主)、小红书(消费研究为主)、知乎(深度阅读为主)三个平台的完整行为得出的。
画像如何驱动推荐:心理学桥接
有了 L5 的人格素描之后,最精彩的部分来了——心理学桥接(Psychological Bridging)。
这个机制是这样运作的:系统根据你的人格素描,推测你可能对哪些你从未接触过的领域感兴趣。比如:
- 一个关注机械表的人 → 可能对建筑美学感兴趣(对精密结构和工艺美术的结合有共鸣)
- 一个看量子物理科普的人 → 可能对哲学有共鸣(都在追问"世界的本质是什么")
- 一个研究咖啡冲煮的人 → 可能对烹饪化学有兴趣(都是精确控制变量、追求理想的萃取)
这种跨域联想,协同过滤永远做不到。因为协同过滤依赖的是"有人从 A 走到了 B",而心理学桥接做的是"根据你的思维方式,推测你可能会喜欢 B"。
当然,推测不等于事实。所以 OpenBiliClaw 给这个机制设计了一个温和的验证流程:猜对了升级为正式兴趣,猜错了安静退出,不影响你的主推荐流。 你会偶尔在推荐列表里看到一两条"探索类"内容,点进去看了就说明猜对了,不感兴趣就划走,系统下次会降低这个方向的权重。
这个设计我觉得非常聪明——它在探索和稳定之间找到了一个不错的平衡点。
另外值得一提的是,这种"猜测→验证→升级或退出"的机制,在机器学习领域有一个更正式的名字叫"探索与利用的平衡"(Exploration-Exploitation Tradeoff)。传统推荐系统倾向于"利用"已知信息(你已经看过的内容类型),而牺牲了"探索"未知领域。OpenBiliClaw 通过心理学桥接把探索的范围从"随机试探"变成了"有依据的推测",让每一次探索都有更高的命中概率。这个思路在推荐系统研究中并不新鲜,但把它做成一个普通用户可用的开源产品,确实是很有价值的尝试。
六、跨平台整合:把被切碎的兴趣重新拼起来
上一章讲的五层画像,有一个重要前提:它需要看到你在多个平台上的行为,才能拼出完整的人格。如果只看 B 站数据,你可能被理解成一个"科技宅";加上小红书数据,系统才发现你还对咖啡、家居、穿搭有深入兴趣;再加上知乎,它才知道你对哲学和计算机科学也有严肃的阅读需求。
这就是跨平台整合的核心价值。
传统方案 vs 跨平台方案
用一个对比表把差异说清楚:
|
对比维度 |
传统单平台推荐 |
OpenBiliClaw 跨平台 |
|
数据来源 |
单一平台内 |
B站 + 小红书 + 抖音 + 知乎 + YouTube + X + Reddit |
|
画像完整度 |
碎片化(只反映你在该平台上的行为) |
综合化(反映你作为完整的人的兴趣) |
|
兴趣迁移 |
不支持。你在 B站的兴趣不会影响小红书的推荐 |
支持。任何平台上的行为都会更新统一画像 |
|
内容来源 |
该平台的内容池 |
跨平台聚合,内容来源更丰富 |
|
推荐多样性 |
被平台内容生态限制 |
跨生态,天然更多样 |
|
隐私归属 |
平台服务器 |
你的本机 SQLite |
这里有一个容易被忽略的点:跨平台不只是"多几个内容来源",而是画像质量的质变。
一个只在 B 站看内容的人,和同一个同时在 B站、小红书、知乎活跃的人,给 OpenBiliClaw 提供的数据量完全不同。后者的画像是立体的、多维的,前者的画像相对单薄。这不是说单平台用户就用不好这个工具,而是说它的优势在多平台用户身上体现得最充分。
一个真实场景还原
假设你在三个平台上分别留下了这些行为痕迹:
- B站:关注了几个科普 UP 主,经常看 20 分钟以上的深度视频,很少点赞但偶尔会收藏
- 小红书:收藏了一堆手冲咖啡的器具笔记,近期搜索过"家用咖啡机 性价比"
- 知乎:读过几篇关于"推荐算法"和"机器学习可解释性"的文章,但没互动
在传统模式下,这三个平台各自为政:
- B站继续推科技科普,偶尔冒出几个咖啡视频(如果科普 UP 主恰好做过咖啡主题)
- 小红书把你当成"咖啡深度用户",首页全是咖啡相关
- 知乎推更多算法类文章,但不太可能推咖啡或科普视频
在 OpenBiliClaw 的统一画像下,系统可能会做这样的推理:
"这个人对事物的'运作原理'有强烈兴趣(B站的科普行为 + 知乎的算法阅读),在消费决策上有研究型倾向(小红书的行为模式:搜索→对比→收藏)。因此,他可能对'咖啡萃取的物理化学原理'这类内容感兴趣——这既满足了他对原理的好奇,又跟他的消费研究需求相关。"
然后系统会主动去搜索这类内容,不管它在哪个平台上。这是传统推荐做不到的。
支持哪些平台
截至写稿时,OpenBiliClaw 支持的平台包括:
- B站(功能最完整,也是项目最初的目标平台)
- 小红书
- 抖音
- 知乎
- YouTube(境外平台,功能持续扩展中,使用需遵守国内网络管理规定)
- X(原 Twitter,境外平台,使用需遵守国内网络管理规定)
- Reddit(境外平台,使用需遵守国内网络管理规定)
⚠️ 合规提醒:针对上述境外内容平台,在国内使用时应当严格遵守网络与内容管理的相关规定。OpenBiliClaw 本身是一个本地运行的内容发现工具,它只帮你发现和索引内容,不提供任何网络访问服务——你能不能访问某个平台,取决于你自己的网络环境和合规情况,与 OpenBiliClaw 无关。在使用过程中,请务必了解和遵守所在地区的法律法规。
七、上手实战:从安装到调教的完整路径
前面讲了那么多原理,现在该动手了。这一节我会把自己的安装配置过程完整梳理一遍,踩过的坑也一并标注。
准备工作
在开始之前,确认你手上有这些:
- 一台电脑(Windows / macOS / Linux 都行,我用的是 macOS)
- Chrome 或 Edge 等 Chromium 内核的浏览器
- 一个 LLM 的 API Key。推荐 DeepSeek,效果不错而且价格很实惠,是默认首选。如果对隐私要求极高,可以用本地的 Ollama 完全离线跑,效果会弱一些但数据完全不离开本机。其他兼容 OpenAI 接口的 API 也可以用。
- 大约 30 分钟的空闲时间(第一次配置需要