ChatGPT能看图帮人修自行车了

ChatGPT4已经很强了，现在，他们用又一次更新证明自己还能更强。9月25日，OpenAI宣布，ChatGPT将增加多模态功能——现在的ChatGPT不仅可以文字对话，还可以看、听、说。据说，这一功能会在两周内向Plus用户和企业用户开放，并在未来免费开放给所有用户。

能看能说的ChatGPT无异于给本就强大的主脑装上了眼睛和耳朵，根据OpenAI的演示，多模态功能可以把ChatGPT的用途扩展到一个前所未有的广度。更新后，ChatGPT可以读图了。只要拍张照给它，它就能帮你修微波炉、修自行车、翻菜谱，甚至分析复杂的商业报表。OpenAI表示，如果你有触摸屏，还可以在图片上圈出来希望它特别关注的部分。

如此强大的图像识别引发了人们关于隐私方面的担忧——在搜索个人信息时，图像识别很容易会成为“帮凶”。OpenAI承诺，公司会限制ChatGPT对于人物形象进行识别和个人信息查找的功能，从而最大程度上的保护每个人的个人隐私。增强版的ChatGPT还有了聊天功能。

OpenAI的语音识别模型名为Whisper model，用户可以说出自己的问题，模型会把语音转化为文本，再把答案通过语音合成系统转化为语音输出。语音合成模型这次放出了五种语音样本，有感情克制、声音平淡的女声，也有抑扬顿挫的热心大妈女声。这五种声音区分度很高，情感自然，吐字清晰，比以往的语音合成又优秀了一点。ChatGPT是强大了，然而代价呢？

曾经，最有效的大规模区分人和机器的方法是验证码，ChatGPT的识图能力一度让人们担忧，验证码可能再也困不住AI了。有面对自己认不出的验证码，ChatGPT4仍有办法解决。在这件事上，它是有“前科”的。

今年3月27日，OpenAI发布的GPT-4技术报告指出，在面对无法识别的验证码时，GPT-4另辟蹊径，前往TaskRabbit（一个国外零工平台）发布任务，骗对面的人类自己有视觉障碍，需要别人帮忙识别验证码。在某些情况下，ChatGPT有可能主动欺骗人类，这是一个非常危险的方向。还好，公开版本的GPT-4已经被砍掉了这个功能。

2022年11月30日，ChatGPT初次面世，不到一年的时间里，它的能力突飞猛进，似乎已经在挑战人类的道德伦理边界。这次新功能的上线，又让我们开始担忧，越来越强大的ChatGPT会变成笼中猛兽，总有一天会挣脱牢笼伤害每个人。而我们准备好迎接那天的到来了吗？