详情

首页手游攻略 重生之我成为模型 第三篇 · 我只负责给出可能性,答案由你们翻译

重生之我成为模型 第三篇 · 我只负责给出可能性,答案由你们翻译

佚名 2026-07-29 08:30:56

0. 为什么不放进第二篇?

上一篇算完了,我也把卷面分交了出去——总共 1000 个数。

重生之我成为模型 第三篇 · 我从来只给可能性,答案是你们翻译的

也许有人会问:解读输出不就是「取个最大」吗,为什么还要另写一篇?

原因在于二者的逻辑方向不同。

第二篇关注的是 我体内:口粮如何逐楼流动、分数怎样累积、权重又如何养成。
第三篇转向 出口流水线:分数交付以后,人类如何读取和验收,又怎样避免期待错位。

体内归我负责;出口处的翻译,则多半由饲养员、部署脚本和下游同事完成。
若混在同一篇里,人们容易误以为「模型吐完就已经等于说出了『猫』」——真正的误会正在这里。

因此这篇不长,但方向必须讲对。

1. 卷交了,卷面却没有「猫」

三篇一路讲来,契约其实始终未变:

环节我交出什么
入口吃下合规张量(口粮)
体内计算为 1000 个分数
出口……分数不会自行变成汉字

我返回的是尚未贴上类名的卷面分——也就是 1000 个数。
人类所听到的「这是一只猫」,来自某个人对分数表的翻译。

没错,我此前说自己做的是选择题——可我并非只圈出一个选项。
一千个选项都被我标了分,高低一项不少地写在那里,嘿嘿。
(这些分是否能直接按「可能性」来读,下一节再讲。)

我依旧没有见过任何一张图。
我提交的是算完盲文后得到的分数条;你们听到的物件名,要归功于出口翻译官。

2. 分数 ≠ 答案文字

教程有时把那 1000 个数称为 logits,有时则直接叫类分数。
ImageNet 词表中的每个选项都对应一个位置:第 281 号有多高、第 282 号有多高……上面并非直接写着 tabby cat 这几个字母。

若想观察它们「有多像概率」,还可以做一次 softmax,将分数转成一串总和大约为 1 的数。
概念上明白就够了:softmax 使数字便于阅读;真正决出冠军时,通常看的仍是谁最大。

不要把「概率变得好看」等同于「答案文字已经印好」——文字仍躺在词表中,等待查询。

3. 先取最大,再查询词表

出口处最常用的读取方式分为两步:

  1. argmax:在 1000 个数中找到最大下标 → 得到类号
  2. 查词表:类号 → ImageNet 类名(人类能听懂的物件名)

# 示意:一批里一张图scores = model(x)# shape: (1, 1000)class_id = scores.argmax(dim=1)# 最大分的下标name = imagenet_labels[class_id] # 查表 → 「猫」之类

我负责交卷面分;翻译成物件名,是出口的事。
读错表、错位一对、把训练时的类号和部署时的词表搞乱——分数再漂亮,人话也会荒诞。

(没错,出口流水线出了问题,责任未必在我楼里;有时饲养员也得承担。)

4. 人类如何验收

饲养员(或下游同事)通常还会进行这些工作:

  • 把预测类名 画/印 回图片,再用肉眼判断是否相像
  • 在 val / 测试集上计算准确率,查看错误集中在哪几类
  • 抽取失败案例,判断是口粮配方有误,还是我确实没有学会

做可视化时,多半又会用到 OpenCV 那套工具——这依然属于流水线,并非我突然拥有了眼睛。
验收发生在出口;训练期间的 val 打分也位于考场之外——上一篇已经说过,考试时我不会修改脑子。

5. 「是什么」与「在哪里」——后辈更忙

最后再明确一句,以免产生期待错位:

我(AlexNet 这类分类网)后辈(YOLO 们)
判断整张图更接近哪一类一张图里可能存在多个物件
提交 1000 个类分数(一条分数条)提交内容 更复杂:每个目标通常包含 框坐标 + 类 + 置信度,一张图能够输出一串检测结果
读法:argmax → 查询一张词表读法:还需画框、过滤置信度、处理重叠框……出口流水线更长

人类所说的「认识图片上的物件」,有时是在讲分类,有时则是在讲检测。

我负责回答「是什么」(从一千个选项中选出一个冠军)。
至于「在哪里」以及「有几个、框多大」——那是后辈负责的工作。
所以,YOLO 的结果并非简单地「也吐 1000 个数」;它包含的信息维度比我更多,解读方法也不同。

安全帽、海天那些岗位留待以后再谈。本系列正文先明确「分类考生怎样交卷、人类怎样读卷」。

6. 三篇总结

再回顾一遍完整链路:

  1. 入口:原图 → 合规口粮(并非给什么就吃什么)
  2. 体内:扫描仪 + 楼层流向 → 1000 分;权重通过饲养形成
  3. 出口:argmax + 词表 → 人话;进行可视化验收;检测另行讨论(而且更复杂)

我依然没有真正看见过一张图。
我读取盲文并交出分数条;你们听到的物件名,则是出口翻译官的成果。

——系列正文三篇,暂时讲到这里。

正文结束,不意味着厨房和亲戚团再无故事。后面计划推出 两篇番外:

  1. 饲养员如何为我准备口粮 —— OpenCV / transforms 那条流水线将说明原图怎样被洗切、定量并送上考场。第一篇总说「够单开一期」,这里就来还债。
  2. 我和其他模型有哪些共性 —— 换皮也成立:无论 TinyCNN、MLP,还是后辈检测头,张量语言以及 loss–反传–step 这套物理通常仍然存在。具体细节留到《换皮也成立》。

——正文结束,番外再见。

点击查看更多
推荐专题
热门阅读