AI 是人构建的软件,不是生物。它包括预测、识别、搜索、生成等多种方法。本课聚焦自回归语言模型:逐个词元生成文本。
技术文献把某些看似合理却错误或缺乏依据的输出称为“幻觉”。这描述的是输出问题,不代表程序有心智或体验人类的幻觉。我们可以避免拟人化机器,同时识别并纠正输出错误。
推理模式可能在作答前投入更多计算,用于中间步骤、搜索或检查。这可能帮助部分任务,但不保证正确。“思考中”等产品标签并不是类人意识体验的证据。
我们将构建小型词级二元模型,统计一个词后出现什么并转成概率。它让条件预测变得直观,但只是教学模型,不是现代神经语言模型的完整算法。
神经语言模型从训练样例中学习数值权重,生成时用权重和当前上下文计算候选词元分数。它并非简单查出存储的互联网句子,也不是只统计紧邻前词的次数。
假设一个虚构分布:蓝色 70%、灰色 20%、橙色 10%,总和为 100%。这是示例,不是 AI 服务的实测数据。采样按概率抽取;在此固定例子中,贪心选择最高概率候选。
采样可能生成不同答案,也可能重复。较小的正温度使分布集中,不会使事实更真实。真实系统中上下文、模型版本、工具和数值执行也会影响结果,所以温度为零也不承诺输出完全相同。
流畅或高概率的答案不一定真实。模型也能自信地表达无依据的主张。应检查证据,而不是把流畅表述当作证明。
概率描述选择,证据支持事实主张。请区分这两种作用。
把 AI 当作工具,不预设人类情感或意图。人仍负责恰当设计与使用系统。识别模型局限有助于选择更好的工具和核查方法,并非对机器作道德判断。
错误输出可能来自模型局限、训练数据、上下文不足、过时检索材料或软件缺陷。清晰的问题有帮助,却不保证正确。先检查原因,不要责怪学习者或认为再问一次就能解决一切。
训练改变权重,使用模型称为推理。把文档加入提示词会改变上下文,不一定改变权重。检索能带来有用来源,但来源和生成的主张仍需核实。
从答案中选一个主张,打开原始来源,检查日期、语境与实际内容。可以的话重新计算数字或运行适当测试。先获取提示,再用自己的话解释核实后的结果。
第一个实验:某词后候选 A 出现三次,B 一次,各自概率是多少?打开构建器前先预测,再比较贪心选择与重复采样。
构建小模型,观察其局限并检查学到的内容。理解机制是善用 AI 的一步。