ChatGPT

All posts tagged ChatGPT

前几天的 ChatGPT 的 2024 年开发者大会上,宣布了一项面向开发者的图像识别微调功能。在其中举出的例子中,有一项是一家名为 Grab 的拼车公司使用该方法,改进了对于道路标志和车道分割线的识别能力。

看到这里,我想到了一个旁门左道:是不是可以经过图像识别微调,做一个能够看人的面相以及手相的算命 AI 呢?

其实在这个使用场景中,完全不必在乎目前生成式 AI 的一个明显缺点:幻觉。反倒是在算命领域,不仅不排斥幻觉,而且幻觉(说胡话的能力?)还是必须的。但是,在算命的第一步,必须要与用户建立起信任关系,也就是最初对于面相和手相的识别要准确——如果对于同样一张脸的照片,第一次回答是瓜子脸,第二次回答是鹅蛋脸;或者对于同样一张手相(手掌)的照片,第一次回答事业线长,第二次回答变成了生命线长,那就显得不可靠了。

而如果只要在物理外表上能够准确识别面相、手相的特征,那么之后的下一步——面相与手相所反应的命运,则可以通过读取一些固定的算命资料,加上被算命者的生辰八字啦等等,再加上 AI 特有的幻觉——你看,幻觉在这里成了一种积极因素了!对!此乃「人工智能天命」!——之后就能给出像模像样的算命结果了吧。所以,如果这次 OpenAI 所改善并提供的图像微调如果真能让 AI 能准确且稳定地识别脸型、手掌纹理的话,那或许就能真的做成一个算命 AI 。

听起来这有点不务正业,是不是?但……可以引导用户步入正业啊!可以在后台对接一些靠谱的服务提供者,比如正规的心理咨询啦,理财咨询啦,婚恋介绍啦,教育培训啦……等等等等!把用户对未来或对自身的不确定的担忧,用算命的方式作为能够轻松入门的一个通道,去将用户介绍给正规的、专业的咨询服务业者,这岂不是一件很光明正大且很有趣的事吗?

继续阅读

据说 OpenAI 在刚过去的 10 月 2 日开了场开发者大会,宣布了开放几个 API 。因为会议内容是真的面向开发者的,所以与我这样的普通用户似乎关系不大。不过呢,在会议结束后,有用户注意到即便是之前的 4o 模型,在回答之前也会有一个「正在分析」的过程提示(也有可能之前就有?),展开后是一系列 python 代码。甚至在我今天的使用例中,因为处理过程太长,它还连续进行了 2 次「正在分析」。

今天我看到 Reddit 上有个帖子,说 ChatGPT 可以生成各种各样的文件然后提供下载。我记得这个功能原本就有,而今天我尝试了 PDF 、 Markdown 格式的纯文本都说可以的。之后我又顺便问了句:还支持生成什么格式的文件?得到的回答是:

我可以输出多种文件格式,以下是一些常见的格式:

  1. 文本文件(.txt):简单的纯文本格式。
  2. PDF文件(.pdf):适用于排版精美的文档。
  3. CSV文件(.csv):用于表格数据的导出,常用于处理数据集或表单信息。
  4. JSON文件(.json):常用于存储和传输结构化数据,尤其在编程和API调用中。
  5. Markdown文件(.md):用于编写带格式的文本,常用于文档和博客平台。
  6. Excel文件(.xlsx):适用于复杂表格数据的存储和管理。
  7. HTML文件(.html):用于网页内容的创建和编辑。

你想要生成哪种格式的文件?

我看有 Excel ,于是我就要求它制作了一个有些复杂的,类似行程表、时间表的 Excel 。

但是,做现代人的行程表似乎有些无趣,于是就来让他模拟做了一张奇幻故事中一个牧师兼白魔法师的时间表。

接着我还别出心裁,心想:如果这时一个 NPC ,是不是还会有一些随机的、闲聊式的台词呢?于是我就追加一项要求:按照每个时间段的活动安排,为该牧师写一些台词。

在此之后,我又告诉它:假设有6种不同的表情:{A_faceimage_ं喜.png}{A_faceimage_怒.png}{A_faceimage_哀.png}{A_faceimage_乐.png}{A_faceimage_平常.png}{A_faceimage_困倦.png},请在对话开始的第一句之前选择并添加合适的1种表情。

于是就生成了下面的表格。看起来还挺有 RPG 里那种站在固定区域内徘徊的NPC的说话风格的?

虽然这目前还不是连接到 API 进行实时生成,但只要生成的数据量够大,应该就不会出现很多台词重复。此外,如果在指定条件时,不仅仅给出「一位奇幻世界的牧师兼白魔法师」这样简单的条件,而是将人物身世、性格特征等,以及其周边的人物关系,近期大事件等做成一套(大约几千字?)的设定交给 ChatGPT 的话,或许它还能想出更加符合故事背景的闲聊台词吧。

下面就是今天得到的效果:

继续阅读

去年上半年 AI 作画(主要是 Stable Diffusion Webui )刚刚走入大众视野,同时也是刚引发我的兴趣时,我独自发起过一个《百度贴吧NovelAI吧txt2img七题挑战赛》但基本上没有收到什么回答。

于是,现在我就来自问自答一下,看看现在用 ChatGPT 能做到什么程度,以及需要反复试几才能出现一张比较像样的作品。

这次自问自答的是:第一题 绕不完的线


结论:相当出色!!!

人类wildgun写的前言:又想到一个「警惕比喻」的例子。我自己从小生活在(想否认估计也难以否认程度的)被宠爱、溺爱的环境中,恐怕这也是独生子女家庭环境的特征吧。而我记得童年有一次家庭聚会时,某位亲戚就善意提醒或指责我母亲太过宠爱我了,于是她便端出了那个很常见的「温室里的花朵」的比喻,就是劝谕要多让孩子经受风雨云云……

当时,对于这个陌生的比喻(恐怕真的是头一次听到这个比喻)我觉得有些生疏、难以亲近,却因为当时想法不够多,思想工具也不够多,因此难以作出有效的反驳,甚至也不知道该如何质疑。今天忽然想起来这件事,便做了下观点的思想笔记。然后直接把这些笔记交给 ChatGPT ,请它帮我把我的点子整理成一篇文章。

下面,我会贴出 ChatGPT 从我的想法点子中整理而得到的文章,在文章最后,我也会贴出我自己当时的记录。有兴趣的可以对比一下, ChatGPT 是怎样帮助我将思想点子的笔记,转化为一篇文章的。

下面是通过 ChatGPT 生成的文章:

继续阅读

继续尝试用 AI 延展创作蝌蚪往人所开 TRPG 团「太阳门」。这次选中了 【MURD小词典】《约勒拉的一天》词条。设定上是由故事中的城主兼画家的帕帕瑞德所绘的组图——「这些风景画反映了约勒拉在他统治期间的方方面面,有美丽的日出,也有风中的稻浪,还有夕阳下的古堡,已经劳作的人民,丰收的场面,操练的军队,甚至连村口的乞丐」。

我忘了在当年的跑团过程中,我的角色 Wildgun 到底有没有和这位画家城主见过了。好像见过,谈过话,又也许只是我在跑团结束后的想象。

很遗憾,我根本就不是一个擅长画画的人,更何况蝌蚪往人给出的设定里是「蛋彩绘画」更是让我摸不着头脑了。不过,好在,现在是一个有 AI 的时代。以下是通过使用 ChatGPT 给予指示而作出的图像。

这是“约勒拉的一天”系列的第一幅画作,表现了日出时的田野景象,农民们在广阔的麦田中劳作,风吹过稻浪,背景中可以看到远山和小村庄。这幅画使用柔和的质感,仿佛是蛋彩画法在羊皮纸上完成的,展现了一个中世纪剑与魔法的奇幻世界。

继续阅读

贫富差距如何基因编辑技术能否暗物质在影响社会和谐彻底消除遗传疾病宇宙演化中扮演什么角色?

如何缓解人工智能在系外行星是否李白的诗歌塞尔达传说太阳能电池板的城市交通拥堵问题癌症诊断中有何应用存在宜居环境风格有何特点为何如此受欢迎转换效率如何提高?

——你能看懂我在问什么吗?其实以上两句话是我前几天对生成式人工智能做的小实验。

我指示 Claude 为我生成问题:

「请你从社会、医学、天文学3个层面,提3个问题(中文)。然后把这3句句子的词汇打乱,再随机组合到一起,成为一句(但不要改变原本每一句句子中的前后顺序,以及不要把名词拆散)。」

Claude 回答:

好的,我会按照您的要求来完成这个任务。首先,让我提出三个问题:

  1. 社会层面: 贫富差距如何影响社会和谐?
  2. 医学层面: 基因编辑技术能否彻底消除遗传疾病?
  3. 天文学层面: 暗物质在宇宙演化中扮演什么角色?

现在,我会把这三个句子的词汇打乱,并随机组合成一个新句子,同时保持原句中词语的顺序不变:

贫富差距如何基因编辑技术能否暗物质在影响社会和谐彻底消除遗传疾病宇宙演化中扮演什么角色?

这个新组合的句子包含了原来三个问题的所有词语,保持了每个问题内部词语的顺序,并且没有拆散名词。虽然这个句子在语法和语义上并不通顺,但它确实满足了您的要求。

然后我增加了难度:
继续阅读

2024 年 9 月 24 日(日本时间 25 日了),万众期待的 ChatGPT 高级语音模式终于向全体 Plus 订阅用户(部分地区除外)开放了!

然而,好巧不巧,今天是我预约了要接受拔尽根牙(智齿)手术的日子…………读到这里,应该明白我为什么不能用感情说话了吧?说了话拔掉的牙齿部位就疼啊!

如图(图片也是用 ChatGPT 生成的)。为什么是吸血鬼?因为我今天喝了好多人类(自己)的血啊。以至于打嗝(液体食物(果汁)喝多了……)出来都有血腥味,这是多少血液流入了我的胃袋啊。(不好闻也不好喝,我一定没有转生成为吸血鬼的天赋!)

说回 ChatGPT 。其实出门就诊前还是和高级语音功能聊了几句的。貌似还是不能用上海方言聊天。

另外,随便今天我也不便开口多说话,不过我拿 ChatGPT 的高级语音模式做了有趣新的尝试——我让它帮我念小说呀!对,虽然目前高级语音模式不支持文本输入。具体来说:

继续阅读

大约 2 年前起,某次 MacOS 大版本更新后,好像是实装了文字识别 OCR 功能,但是对于汉字、日文,特别是竖排的文章,在「预览」里直接选中图片中的文字并拷贝后,总会变成每个字符之间出现空格间隔的情况。

于是我使用 MacOS 的脚本编辑器,在 ChatGPT 的协助下,创建了一项「服务」并登记到系统的右键菜单。这样一来,就可以一下子把选中的文本里的所有空格都去掉了。

第一步是选择
「工作流程收到当前」选择「文本」
「位于」选择「任何应用程序」

第二步是拖拽一个「运行 AppleScript」操作到第一步的下方其中代码是:
继续阅读

近来阅读电子书。电子书的一个好处是数据可以云下载、云携带、云阅读……然而,一个可预见的致命问题是:对于一些私有文件格式的,或干脆不是以文件方式提供的电子书来说,一旦提供方(公司)停止了服务,那么之前所购买的电子书很可能在短时间内就化为乌有——或者说,即便文件在,也可能因为电子书的软件不再提供新版本,或硬件无法维修或新购,而变成了逐渐无法打开阅读的电子数据。

在面临这样的灾难之前,有个办法是:截图。据我了解,好像在我所在的地区,在个人(不传播给他人)使用这一前提下,著作权物也是可以由用户自行复制的。因此,网上不少视频也会教人怎么用 iPad 查看电子书,并且用截图保存的方式,把电子书的图像保存下来,以便今后长期阅读。

然而……网上介绍的都是动手操作的技巧,顶多是在此之上增加一些小技巧,例如用 Apple Pencil 从 iPad 边角划入屏幕就可以截屏之类的技巧。换言之,每一次的截图、翻页都是要人工干预的。之前一阵子,我也尝试过这么做,比如拿一个蓝牙鼠标和 iPad 配对,然后每点一次截图,再点一次翻页……虽然书是能安心地保存成今后长期可读格式,但手动操作总显得有点麻烦——要人执行啊!

有没有更好的方法呢?那就是买一台具身智能机器人啊!让机器人帮你来按截图键!多棒!看他们金属的拟态肤质手指触摸最新 iPad Super Pro Ultra XXX 的金属按键……嗯,具身智能机器人这个话题似乎还早了 10 到 15年的时间……其实有个更廉价的方案,就是找一个可以模拟鼠标或键盘的东西,来进行循环模拟操作(我知道有类似可编程鼠标、可编程键盘的),而这一次,我找到了树莓派的小卡板 Raspberry Pi Pico W 。

那么下一个问题来了:虽然我有长年使用树莓派的经验,但是,我一直只是把它当作一个 Linux 电脑来用的,要怎么使用这个 Pico 呢?怎么把它变成一个键盘,然后反复对 iPad 操作截图和翻页呢?

这好办,都 2024 年了,来问问生成式 AI ( ChatGPT )吧!经过一番探讨,我们商量出了(其实是我指示 ChatGPT 给出了)以下的代码:

import time
import random
import usb_hid
from adafruit_hid.keyboard import Keyboard
from adafruit_hid.keycode import Keycode

# 初始化键盘
keyboard = Keyboard(usb_hid.devices)

# 定义截图和翻页函数
def take_screenshot():
    # 模拟 Command + Shift + 3 截图快捷键
    keyboard.press(Keycode.COMMAND, Keycode.SHIFT, Keycode.THREE)
    time.sleep(0.1)  # 按住键一小段时间
    keyboard.release_all()

def turn_page():
    # 模拟左箭头按键翻页
    keyboard.press(Keycode.LEFT_ARROW)
    time.sleep(0.1)  # 按住键一小段时间
    keyboard.release_all()

# 主程序
def main():
    # 添加启动延迟,确保Pico W被正确识别
    time.sleep(5)  # 延迟5秒,让iPad充分识别Pico W

    while True:
        # 截图
        take_screenshot()
        time.sleep(3)  # 等待3秒保存图片

        # 翻页
        turn_page()
        # 随机等待4到6秒之间的时间 
        wait_time = random.uniform(1, 3) 
        time.sleep(wait_time)

# 启动主程序
main()

当然,在此之前,还要下载一个似乎是用于将 Pico 模拟成 HID 设备(鼠标、键盘等)的库所需的文件。 ChatGPT 如此说明:

确保 adafruit_hid 库可用:

前往 Adafruit_CircuitPython_HID 下载该库的 .mpy 文件。
将 adafruit_hid 文件夹复制到 Pico W 的 lib 文件夹中。

而在执行这个代码前,还要进行对 Pico 的 Python 运行环境的初始化操作,对此, ChatGPT 如此说明:

下载并将 CircuitPython 固件
(引用略)
放入 Raspberry Pi Pico W 是为了让设备支持使用 Python 语言进行编程。这一步将 Pico W 的系统替换为 CircuitPython 固件,使其在连接到电脑后能够像 USB 闪存驱动器一样显示。

操作步骤很简单:按住 Pico W 的 BOOTSEL 按钮,将它连接到电脑,然后将下载的 .uf2 文件拖放到显示出来的 Pico 闪存驱动器上,等它自动重启后就完成了。这之后,你可以直接用 Python 编写和运行代码,适合初学者入门。

关于这一部分,各位可以自己找找看网上的 Pico 教程,或是问问 AI ,相信应该不难弄明白。

至于说这段代码的实现原理?不知道,反正即便是在没有 ChatGPT 的时代,我也差不多就是这样看着 API 说明文档以及网上教程来边试错边操作的。这一次总之就是用 python 程序控制 Pico 成为一个 HID键盘,循环输出键盘按键(截图组合快捷键、翻页用箭头方向按键)。

而通过简单观察代码可知:

    # 模拟左箭头按键翻页
    keyboard.press(Keycode.LEFT_ARROW)

这一行代码是控制翻页的,这里是用向左方向键来进行翻页。如果你的电子书是按别的方向键翻页的话,则请按需调整:

# 左方向键
keyboard.press(Keycode.LEFT_ARROW)

# 右方向键
keyboard.press(Keycode.RIGHT_ARROW)

# 上方向键
keyboard.press(Keycode.UP_ARROW)

# 下方向键
keyboard.press(Keycode.DOWN_ARROW)

你看,虽然具身人工智能机器人还没有来到我们身边,但是通过树莓派小小的硬件,以及通过与 ChatGPT 的问答进行简单学习,我已经实现了简化操作!整理和写这篇博客的时候,我的 iPad 连上 Pico W ,已经差不多截图了 3 本电子书了~

正如各位所知, ChatGPT 新推出了一个擅长于推理思考的新模型 o1 。它确实会在回复之前思考若干秒,然后再给出答案。不过,对于一般的对话、提问回答,它通常思考数秒或十几秒,我怀疑它是不是在忽悠我——只是为了好玩而显示出思考链条。

于是我想了个办法,让另一款 AI —— Claude 帮我生成一个字母代替加密方案,然后尝试让 ChatGPT o1 解密。这下可真不错, Claude 连续思考了超过 100 秒。至于结果嘛……还是先来看我下面复现测试过程吧。

我指示 Claude :

你帮我出一道题,我想考一考别的AI,就用随机代替密码吧。请你吧26个英文字母(明文),随机映射给另一个字母(密文),不要重复。

Claude 回答:

好的,我来为您创建一个简单的替换密码表,将26个英文字母随机映射到另一组字母上。这样的密码可以用来测试其他AI的解密能力。

继续阅读