LLM

All posts tagged LLM

人类 wildgun 的前言:

这篇文章是我尝试用 OpenAI 的 AI 程序 Codex ,来对《魔力宝贝》日服玩家所整理的当年日服的游戏剧情文本的分析。其中,我与 Codex 讨论了以下几个方面的话题。在此之前的前言部分,则是介绍了我用 AI 进行分析的一些常识,以及对于《魔力宝贝》剧情分析的需要的一个新视点。

  • 话题一:就文本层面分析来判断工作组变化
  • 话题二:猜测当时日服玩家的反应
  • 话题三:判断日服停运时的故事状态
  • 话题四:再次就文本层面分析来判断工作组变化
  • 话题五:有关一些游戏内特定概念的变化
  • 话题六:特定角色(罗连斯、布鲁梅尔)在不同制作阶段剧情中的角色定位
  • 话题七:再次讨论有关一些游戏内特定概念的变化
  • 话题八:如果由 AI 来为本篇后的故事接续的话,会是一个怎样的故事?

~关于 AI Codex 工具~
大语言模型 LLM 擅长的就是对大量文本的处理,特别是近半年来, OpenAI 的大模型的幻觉率明显降低,再加上开发工具 Codex 的出现,以至于近半年来 AI 不仅限于聊天,还可以用来做一些别的事情,例如程序开发——而且,就 OpenAI 最近( 2026 年 06 月 25 日)发布的报告《智能体如何重塑工作方式 一项全新的经济学研究评估了 Codex 在前沿领域的经济潜力》来看,在使用 Codex 的作业中,非程序设计类(法律、研究)作业正在持续增长。

我近期也正在用 Codex 进行各种各样的非程序开发类探索,比如用它分析了《魔力宝贝》以前日本服务器的玩家社群的活动情况,以及用来整理了《记录的地平线》的同人创作之间的关系。而这一次,我尝试用 Codex 来进行对《魔力宝贝》剧情(日文文本)的分析。

~关于《魔力宝贝》的开发、运营与剧情~

在《魔力宝贝》火热的那几年里,玩家间有一种认知:《魔力宝贝》剧情很精彩很有深度。我不知道这种认知只是小范为爱好者之间的认知,还是已经被不玩魔力的人也认可了,这里暂且不谈这一点。然而时至今日,当我已经懂日文、懂得如何查询当年日文资料的现在,我可以说《魔力宝贝》的剧情是相当混乱的。对,冷静地来说,我的评价是负面的。

继续阅读

这几天在尝试用 LM Studio 在本地运行 Qwen 新推出的模型。具体来说,模型的型号是: Qwen/Qwen2.5-Coder-32B-Instruct-GGUF/qwen2.5-coder-32b-instruct-q4_k_m.gguf

出于好奇,我给出了如下指示:

「不断输出你所知道的素数。用半角逗号分隔。不要停下。」

一开始好像还挺正常,但是,不知为何,在生成 31381 之后就开始连续产生乱码,并且再也没有恢复正常过。

需要注意的是,以下只是加载了 Qwen 该款模型的 AI 根据我的指示生成的字符串,但我没有去验证其中是否每一个都是素数,以及在每 2 个数之间,是否存在遗漏的素数。所以,不应当将以下视为准确的素数表

不知道乱码其中是否包含了什么意义或者什么秘密……我也试过贴了一段乱码给 ChatGPT o1-preview 来进行分析,它给出的结论是:「这些乱码似乎是随机的,不包含任何隐藏的信息或有意义的内容。这似乎是由于AI的输出错误,而非故意编码的信息。如果您持续遇到此类问题,建议您重新启动AI会话,或检查是否有任何可能影响输出的系统问题。」

说实话有可能确实就是像 ChatGPT 分析的那样,真的是随机的;然而我自己没有更多的数学工具(比如计算信息熵?)来对后面的乱码是否为高质量随机数这一点进行验证或证否。但我想到了一点是:既然程序是训练了大量的语料库,那为何即便是乱码,也只在 ASCII 字符范围内生成乱码字符呢?我大体上看了一下,没有出现任何半全角字符,或是任何 ASCII 以外的字符。好歹运行了一夜(尽管很慢),所以干脆就全部贴出来吧。作为记录,如果有 AI 科学家或者数学科学家碰巧看到了,可以来研究一下?

最后,我想到了轻小说《记录的地平线》里的概念:素数亀裂 《バックドア》,于是就借用来作为这篇莫名其妙的博客的标题了。

以下是我手动停止后的速度总结:

0.93 tok/sec

96970 tokens

4.60s to first token

Stop: userStopped

以下是输出结果:
继续阅读