← 全部文章

Star 数只告诉你结果,不告诉你原因

一个粘 URL 就能跑的开源项目质检工具——从「翻车」到「九维度」的故事

Star 数只告诉你结果,不告诉你原因

你有没有想过:为什么有些项目代码写得很好,star 却长得慢?

star 数只告诉你结果——有人点了那个按钮。但它不告诉你原因:是 README 写得好?还是 CI 齐全让人放心?还是单纯被大 V 带了一波?

我在做一个叫 Scorecard 的小工具,把项目成熟度拆成九个维度,每一维只看客观证据——API 拿得到、文件在不在、状态码是多少。这次想聊聊它怎么来的、踩了什么坑、以及第九维「AI 可读性」是怎么把自己打脸的。

为什么要拆成九维

大多数人看一个项目,看的是 README 和 star 数。但这俩信息量太少了。

我给自己定的问题是:「陌生人 10 秒内会不会 star 这个项目?」 把这个问题拆开,就是这些维度:

维度 它在回答什么问题
门面 第一眼能不能看懂「这是什么」
分发 能不能装上——npm / brew / Docker
发布工程 有没有 semver tag、CHANGELOG、发版节奏
质量护栏 CI、测试、lint 在不在
社区卫生 有没有 CONTRIBUTING、issue 模板
文档 快速开始、示例够不够
安全 依赖有没有漏洞、有没有 SECURITY.md
度量 star 增速、fork 比、下载量
AI 可读性 AI 爬虫能不能读到你的内容

九个维度,每个 0-10 分,加权汇总。不是打个分了事——每条都带证据和整改建议

最初的版本:CLI 工具

最早 Scorecard 是一个命令行工具:

bun run audit webkubor/scorecard

跑完输出一份 Markdown 报告,每个维度列出了证据(evidence)、差距(gaps)和改了能涨多少分。

CLI 版能用,但有个问题:没人愿意为了查一个项目先装一个工具。

改成 Web 版:粘 URL 就能跑

所以我做了一个 Web 版:把 GitHub URL 粘进去,几秒钟拿到完整报告。

scorecard.webkubor.online

不需要登录,公开仓库不需要 token。配一个只读 token 可以把限额从 60 次/小时提到 5000 次,但不配也能跑。

后端是 Bun + Hono,前端是 Vue。后端做质检引擎,前端做报告面板。

报告长什么样

输出不是单一分数,而是三样东西:

  • 雷达图 —— 九个维度的分数一眼看完
  • 整改清单 —— 按「影响 ÷ 成本」排序,先改收益最大的
  • Markdown 报告 —— 可以一键复制,直接粘给 AI 让它帮你改

整改清单里每条都带「改完预计 +X 分」,不是含糊的「建议改进」。

第九维:AI 可读性

前八维是比较传统的。第九维是我加的,灵感来自一次翻车。

我在做一个叫 Scorecard 的小工具——等等,就是这个。我拿它扫自己的项目,发现一个问题:我的官网屏蔽了 AI 爬虫,而我完全不知道。

Cloudflare 托管的 robots.txt 默认屏蔽 GPTBot、ClaudeBot 这些 AI 爬虫。你的内容可以被 Google 索引,但 ChatGPT、Perplexity 引用不了你。

翻车实录

第一刀砍下去:修了 robots.txt,放行 AI 爬虫。以为搞定了。

第二天准备分享的时候又查了一遍——修完一层还有第二层。robots.txt 放行了,但 meta tag 里还有 noai。这是两个独立的屏蔽机制,只修一个等于没修。

这个经历让我意识到:AI 可读性是一个需要主动检查的东西,不是默认就有的。

第九维检查什么

检查项 看什么
AGENTS.md 仓库根目录有没有给 AI 的工作指引
llms.txt 有没有给 LLM 的内容清单
robots.txt 官网有没有放行 AI 爬虫
官网 meta tag 有没有 noai / noimageai

这四个都是客观判据——文件在不在、状态码是多少,不需要模型判断。

评分不是目的,行动才是

Scorecard 的评分标准分四档:

分数段 含义
9-10 同品类头部:有渠道、有度量、发布全自动
6-8 工程健康但分发薄弱:「好代码没人看」
3-5 能用但门面/发布有欠账
0-2 个人练习仓库

大多数个人项目在 3-5 之间,不是代码差,是门面没做好——README 没写清楚、没有 CHANGELOG、没有 CI。

Scorecard 的核心理念是:每条结论都带证据,每个差距都带整改建议和预计收益。你说「文档有待完善」没用,要说「缺 CONTRIBUTING.md,加上预计 +0.3 分」。

引擎是权威,skill 是深度

Scorecard 有两层:

层级 做什么 适合什么
Web 引擎 广度扫描 + 趋势追踪 一键扫 20 个仓库、定时跑、看趋势
AI Skill 深度诊断 + 修复方案 读 README、给整改方案、帮你改

引擎做客观项——API 拿得到的。Skill 做主观项——「README 首屏 10 秒能不能讲清楚」这种要模型读了才知道。

两边必须同一套维度标准,否则面板给 7 分、skill 给 4 分,人就不知道该信谁了。

技术栈

前端:Vue + Vite
后端:Bun + Hono
API:GitHub REST API
部署:Bun server 托管 dist/

没有数据库,没有用户系统。报告是实时算的,缓存在内存里。设计原则是能不加的东西就不加——每个依赖都是负债。

你可以试的

打开 scorecard.webkubor.online,粘一个你熟悉的仓库链接。跑完你会看到:

  • 你的项目在哪几维得分高
  • 哪几维有差距
  • 先改什么收益最大

如果你觉得哪个维度不合理、或者漏了什么,欢迎来提 issue。评分标准不是我一个人说了算的。