张逸骅
文章
随记
今天才搞懂了之前我在乐理认知上的一个小误区,这个问题是源于,一个 Cm6 和弦的一个六度音到底是 A 还是 Ab。当然肯定很多人一下就反应过来说,你这个肯定是 A,就是距离根音大六度的音,怎么可能是 Ab 呢。但我之前对 Cm 系列和弦的理解,其实一直是另一套逻辑,今天和 ChatGPT 讨论之后才发现自己的认识是错误的。我原来始终认为,只要写成 CmX,不管后面的 X 是多少,这些三度堆叠的扩展音都应该从 C minor 音阶里取。这么理解其实一度非常自洽。比如 Cm7,是 C–Eb–G–Bb,没问题,因为 Eb 和 Bb 都是 C minor 的调内音。这个逻辑甚至一直到 Cm11 看起来都没出问题,因为 C minor 的 2(9)级和 4(11)级分别是 D 和 F,刚好和 C major 里也是一样的。问题出在 Cm13 (或者简单一点 Cm6),因为到了六级音,大调和小调终于产生了分歧,C major 里是 A,C natural minor 里则是 Ab。那么经过 GPT 老师的纠正,我才知道原来那 Cm 里边的那个 m 只管三级音的高低,而不对后边的音有耦合效果,后边的2/4/6音全部都是取自然大调上的音,即大二度、纯四度和大六度。一个挺有趣的错误。不过把这个误区纠正之后,反而感觉自己对和弦标记系统的理解更自洽了。
今天才有时间好好看了一下 HBO 剧版《哈利·波特》的预告,可以说非常突破预期。
作为一个读过至少五遍《哈利·波特》原著的拉文克劳,我始终对影版《哈利·波特》抱有一些遗憾。在讨论新的剧版《哈利·波特》之前,我想先总结一下自己对影版的看法。
首先,从整体上说,影版《哈利·波特》无疑是成功的。它成功地把《哈利·波特》这个 IP 的知名度推向了一个新的高度;它的 OST 也是我最喜欢的影视配乐之一,可以和《进击的巨人》以及《权力的游戏》并列。作为《哈利·波特》影视化的第一次尝试,它在视觉世界的构建、呈现以及人物塑造方面都达到了相当高的水准,对于各种魔法的展现也足以令人满意,尤其是考虑到这一系列电影已经是十几年乃至二十多年前的作品了。我们不应该完全用今天的评价标准,去对一部十几二十年前的作品进行全方位批斗。有意思的是,《哈利·波特与魔法石》(2001)其实和《雍正王朝》(1999)几乎是同时期的作品。
尽管如此,接下来我还是想说一说自己对于影版《哈利·波特》的遗憾。
首先,我们应该正确认识一件事情:所谓“影版《哈利·波特》是成功的”,其实是基于“影版《哈利·波特》和原著是两个不同作品”这一视角做出的评价。但如果考虑到许多原著党所追求的对于原著的“还原度”,那么影版《哈利·波特》的评价无疑就要打一个很大的折扣。
不过,我个人认为,一部电影对原著进行合理改编,无论是在情节还是人物塑造上,都是无可非议的,只要最终能够讲完一个完整的故事。然而,单就“完整的故事”这一点来说,影版《哈利·波特》是绝对不能及格的。
从第一部电影到最后一部,影版《哈利·波特》都对原著中一些对故事走向具有决定性作用的情节进行了大幅缩减,导致许多非常精彩、同时又非常重要的故事情节没有被体现出来。注意,我们这里评价的并不是是否“完全还原原著”,而是有没有把故事本身讲完整。
其中最令人咋舌的删减,无疑出现在《哈利·波特与混血王子》中。原著里有关伏地魔身世、崛起以及魂器来源的这条“暗线”,在电影中几乎被全部删除了。例如,年轻时的伏地魔如何发现自己的身世、如何找到冈特一家、如何杀死自己的麻瓜父亲,又是如何逐渐把那些具有特殊意义的物件选作魂器;这些记忆共同解释了伏地魔为什么会制造这些魂器,以及邓布利多为什么能够一步步判断出它们可能是什么。而这些内容对于理解伏地魔这个人物,以及整个故事后期的发展,无疑都是至关重要的。即使考虑到电影时长的限制,把这类重要剧情大幅删除,依然是对故事完整度的严重削弱。
又比如《哈利·波特与火焰杯》中,电影虽然在最后交代了小巴蒂·克劳奇通过复方汤剂假扮疯眼汉穆迪,但他究竟是如何逃出阿兹卡班、如何被父亲长期控制、又如何在魁地奇世界杯上暂时摆脱控制,闪闪在其中扮演了什么角色,以及他和父亲巴蒂·克劳奇之间复杂的关系,几乎全部都被删除了。甚至连他最后杀死自己父亲的前因后果,也没有得到真正展开。至于小精灵闪闪这个角色、赫敏为了争取家养小精灵权益而成立的“小精灵权益促进会”,以及多比在这一阶段的大量戏份,也都被删去或转移给了其他角色。这其实是反映赫敏性格、价值观和人物成长非常重要的一部分。丽塔·斯基特也仅仅以近似“路人甲”的形式露了几次面。她未注册阿尼玛格斯的身份、她究竟如何在那些不可能出现的地方获取第一手消息,以及赫敏最后如何一步步识破她的秘密,这整条故事线当然也全部被略过了。
类似的问题在《哈利·波特与阿兹卡班的囚徒》中其实更加明显。电影保留了“活点地图”这样一个非常重要的道具,却几乎删除了它背后完整的“劫盗者”四人帮的故事。只看电影的观众很难真正明白,为什么卢平一看到活点地图就知道它是什么,为什么地图的四位作者分别叫“月亮脸、虫尾巴、大脚板和尖头叉子”,又为什么詹姆能够变成牡鹿、小天狼星能够变成狗,彼得能够变成老鼠。他们当年之所以冒险学习成为非法阿尼玛格斯,本来正是为了在卢平变成狼人时陪伴他;而这段少年时代的友情,又直接解释了后来尖叫棚屋、打人柳、活点地图乃至守护神等诸多情节。电影把结果保留下来了,却把这些结果背后的因果关系大幅删除。对于没有读过原著的观众来说,这些设定很多时候就只能停留在“这是魔法世界里的一个东西”,而无法理解它为什么会出现在这里。
其实,从书本的厚度也能看出,J.K. 罗琳对于整部作品细节的把控,以及前后文伏笔与 callback 的设计,都做到了令人瞠目结舌的地步。而这些细节,终究没有完整体现在电影之中。所以,我所说的“遗憾”,并不是认为影版《哈利·波特》本来就应该和原著一丝不差,而是说:《哈利·波特》原著真正精彩的程度,只看过电影的观众可能连一半都没有欣赏到。至于其他方面,比如影版对于哈利性格成长描绘的失败、主角的“篡位”、哈利扮演者丹尼尔本人的演技等,已经有很多 Bilibili 的 UP 主做过非常详细的解剖,这里就不再展开了。
说回剧版的预告。从目前的预告中,我们既能看到惊喜,也能看到惊吓。当然,惊喜居多。
惊喜首先来自于它对于各种细节的展现。注意,我这里依然没有使用“还原”这个词,因为预告中仍然存在一些和原著不完全一致的地方。但至少我们可以看到,导演确实考虑到了这些细节,也考虑到了它们对于情节推进和人物塑造的作用。
除此之外,各种角色目前展现出来的演技、更贴近原著文字描述的选角,比如赫敏本来就并不是故事里最漂亮的女孩,以及一些在电影中属于“非主要人物”的角色重新获得出场机会,这些都让我非常期待。所谓“惊吓”,可能主要还是来自斯内普的黑人演员选角。当然,单从预告片所展示的台词功底来看,这位演员的水平绝对足以支撑斯内普这个角色。问题在于,斯内普原本就是“食死徒”的一员,而食死徒本身就是一个建立在血统歧视之上的群体。在这样的人物设定下,选择一位黑人演员出演斯内普,从角色所处的文化语境和视觉观感上来说,多少还是会让人产生一种违和感。这大概也是很多观众难以接受斯内普选角的原因,即使这位演员的学院派演技并不输给影版斯内普。我甚至很难想象斯内普帮卢平代课、使用幻灯片讲狼人的那个场景:黑人演员穿着黑色讲师袍,最后站在一片黑色的背景里…… 至于其他角色的选角,我目前甚至认为完全不输影版。对于其中一些主角来说,他们甚至有突破影版角色形象的潜力。
无论如何,翻拍一部已经如此成功、并且拥有庞大受众基础的作品,无疑要承受巨大的压力。如何拍出新意,同时又让剧版形成属于自己的特色,是这次改编最关键的问题。幸运的是,相比影版,剧版至少拥有两个无可比拟的优势。
第一,剧版拥有更长的时长。
这意味着它可以展现更多情节、更多原著中的设计,也可以用更多篇幅塑造那些在原著中性格鲜明、但在电影里被严重压缩的“非主要角色”。比如纳威·隆巴顿的身世和他父母的故事、卢娜和哈利之间的故事、秋·张这样在电影中没有得到太多展开的角色,以及诸多反派角色。这些内容都有机会被重新展开,从而弥补影版最大的遗憾之一。
第二,和影版拍摄时期不同,如今《哈利·波特》早已完结。
这意味着哪些细节是伏笔,哪些地方在后文会形成呼应,哪些看似不重要的设定最终会发挥作用,现在已经全部一清二楚。我知道,在影版拍摄过程中,编剧曾经提前得知一些尚未正式出版的《哈利·波特》后续情节,但即使如此,他们对于整套原著内部究竟有哪些伏笔、这些伏笔最终会怎样完成闭环,也不可能像今天这样拥有完整的全局视角。比如我记得,在第一部小说中,哈利第一次看到城堡里的那些雕像时,作者就对它们做了相当细致的描写。哈利当时的第一感觉就是:“它们可能真的能动起来。” 而到了最后一部的霍格沃茨保卫战中,麦格教授真的使用魔法让这些雕像全部行动起来,参与战斗、保卫校园。
这就是《哈利·波特》原著最迷人的地方之一:许多你第一次阅读时认为只是为了丰富世界观而出现的细节,到了几本书之后,才突然发现,它从来都不是一个随手写下的细节。
东野圭吾的《新参者》是一本很有意思的小说。如果从读者的角度来看,这本本格推理小说从一个完全不同的维度展开,将一个刑警探案的过程完整而真实地展现了出来。我认为,把《新参者》和其他推理小说区分开的地方主要有两个:一个是情节推进的方式,另一个是案件叙述的真实度。
我觉得可以把读者阅读小说、逐步揭开案件真相的过程和欣赏一幅画作比较。这一次,作者在引导观众“欣赏画作”,是从图层的角度开始的。就像使用 Photoshop 一样,我们可以引入“图层”的概念。在每一个图层里,作者都需要画出一幅真实而完整的画。这幅画有虚有实,有主线也有细节,但看起来似乎和整幅画的主题没有直接关系。可是,当这些图层叠加在一起时,就会发现它们彼此交织,最终组成了一个完整而真实的主题。读者每次重新开始,并不是沿着一幅完整的画从头欣赏到尾,而是一个图层一个图层地看。每个图层都各有特色,下一个图层往往还会用到上一个图层中的一些元素。直到最后一个图层显现,整幅画的主题才真正跃然纸上。
而所谓案件叙述的真实性,是指以往在推理小说中,对案件的叙述往往只集中在与案件直接相关、或者能够推动案件发展的关键细节上。但刑警在实际办案时,往往会遇到一些与案件本身无关、却与真实情况不符的供述。这些虚假的供述各有各的目的,却未必与案件真相有关。刑警需要从这些与案件真相无关、却又会切实影响办案者判断的真假口供中抽丝剥茧,寻找真正的答案。而揭开这些虚假口供背后的原因与过程,本身又塑造出了一个个真实的角色、家庭和故事。
谁说没有 Mom's favorite child? 我用两个 Claude session,一模一样的 model 和 thinking efforts,我都隐隐觉得一个session比另一个session聪明,重要的活儿都会倾向交给更聪明的那个干 LoL
听力训练似乎从来没有作为一个正式的学科,在学生时代被严肃训练过。我在成年之后的德语备考时期,才真正认识到了这个教训。
很多人看到这个“暴论”可能会觉得奇怪:我作为一个人,从刚出生到现在,所有听到的语言肯定比自己说出来的还要多,你怎么能说我听不明白东西呢?我一开始其实也没有严肃思考过这个问题。我们从一个现象出发:作为一个 typical 中国学生,如果想要考 TOEFL(几乎所有外国人来美国前都需要经历的标准英语考试,难度大概是 University Lecture Level)估计最难准备的一个是听力,一个是口语,这个可能算是共识。但是我们通常会认为自己的听力不好,是因为单词记不住、句子结构不熟悉等等,却很容易忽略一个重要的问题:同样复杂度的信息,如果直接用你的母语让你听一遍,你能回答对同样的问题吗?
上边这个“暴论”,其实源自我自己的外语学习经历。我高中时 TOEFL 就考到了 110 分以上,大学期间开始学习德语,学习了四年后参加 TestDaF 考试并通过 4x4,大概类似于德语版 TOEFL 100 分的水平。整个备考流程中,让我感觉最强烈的一件事情就是:我的脑子在听到信息的时候,经常处理不过来。
这种“处理不过来”并不是因为翻译不过来,而是当信息具有一定复杂度的时候,尤其是需要快速、仅仅通过听觉进入一个信息语境的时候,比如突然开始听某一个主题的讲座,而你在听之前完全不知道它要讲什么,我很难持续处理信息之间的逻辑关系。前一句话可能还没有完全理清,后一句话已经进来了;某一个逻辑关系一旦没有接住,后面的信息就很容易一起断掉。这种缺陷一方面来自于本身对复杂信息的处理能力就弱,另一方面可能来自于面对复杂信息时,大脑的一种本能逃避反应,也就是我们俗称的“走神”。
“走神”是一个比较笼统且不准确的说法。时间回溯到十年前,一个中学生“上课走神”这件事情似乎再正常不过了。老师看到一个学生上课走神,很自然地可能会理解为:这个学生在想其他事情,想出去玩,或者单纯对课堂内容没有兴趣。但是现在回头看,我觉得可能还有一个一直没有被发现的主要原因:他的听力信息处理能力太弱,导致“走神”本身就是一个本能的大脑逃避过程。也就是说,并不是这个学生有什么其他事情想干,可能只是他的大脑在某个地方没有处理过来,于是单纯地逃避了。
一旦这种逃避形成习惯,后边造成的影响就是,在未来类似的场景里,大脑会不受控制地继续逃避。参加一次听力考试,遇到比较复杂的信息,就无法形成持续的注意力;即便主动参加一个自己感兴趣的讲座,到了稍微复杂一点的内容,也会忍不住走神;参加一个公司的会议,同事讲到一些自己不熟悉的内容,会不自觉地溜号;甚至未来在和伴侣争论、吵架的时候,也可能因为无法正确理解对方的逻辑和信息,导致吵架从一个话题转移到另一个话题,然后无休止地进行下去。
这里我觉得有一点很重要:上边这些现象,很多时候都是“下意识”,甚至是“违抗人的意志”发生的。你可能主观上真的很想听懂这场讲座,很想认真参加这个会议,也很想听明白对方到底在说什么,但是信息一旦超过某一个复杂度,大脑还是会自动开始逃避。我现在越来越觉得,上边这些看起来完全不同的问题,根本原因可能都和同一件事情有关:听力太差。
回到更初级的课堂上,比如小学课堂。每个国家都会有自己的母语课堂,比如中国人的语文课,或者美国人的英语课。大家都会开设包括写作、阅读,甚至是口语在内的语言训练,但是唯独很少有真正意义上的“听力课”。我这里说的“听力课”,不是让学生坐在那里听老师讲话,而是专门训练怎么通过听觉处理复杂信息,包括复杂语境下的信息分析、情感分析、逻辑关系,以及专注力的训练。你当然可以说,我们用母语上的所有课其实都是“听力课”,因为学生每天都坐在那里听老师讲话。但是这些“听力课”提供的,并不是以培养“听力”为目标的训练。
做大模型训练的人应该都知道,在 multi-task learning 的过程中,一个 task 涨分,很可能引起的就是另一个 task 掉分。你把很多 task 放在一起训练,并不意味着所有能力都会自然变好,最后强化的仍然取决于你的 training objective 是什么。类比到这里,我们每天当然都在“听”,但是这些课程的直接目标从来都不是训练“怎么听”。而如果一个能力没有被作为目标专门训练过,那么大量重复本身未必能够让它变好。甚至反过来,我们这些“不以听力为目标”的课程,可能做的只是把原本接收别人信息时已经存在的习惯,重复了很多很多遍。好的习惯被不断强化,坏的习惯其实也是一样。
那么听力到底该如何练习呢?我个人觉得,播客是一个不错的途径。而且使用母语练习听力,可能反而比使用外语更好,因为这样可以尽可能排除语言本身带来的困难,把训练目标集中在“听”这件事情本身。和听大学课程相比,播客的主题更加多样,很多播客的时长也足够长,并且能够保持一定的内容深度。我觉得我们在训练听力的过程中,其实就是希望自己经常遇到一些信息上的“遭遇战”。如果你是玩《红色警戒》长大的,一定对“遭遇战”这个概念不陌生:你事先不知道接下来会遇到什么,只能在信息不断出现的过程中,一边接收,一边判断。听力训练其实也可以是类似的过程。我们希望在自己对内容完全没有准备的情况下,突然来上一场有深度、有层次的主题报告,然后在播客结束之后,尽可能地复述里边的逻辑层次。这里需要强调的是,琐碎的信息其实并不重要,比如某一个具体的人名、数字或者例子没有记住,并不会影响训练的效果。真正需要抓住的是整个播客的逻辑,或者说,这个“故事”到底是怎么一步一步讲出来的:它从哪里开始,中间经过了哪些转折,为什么会从一个问题走到另一个问题,最后又是怎么得到结论的。我觉得这种训练真正锻炼的,一方面是长时间保持专注力的能力,另一方面则是大脑对听觉收集到的信息进行持续处理、组织和建立逻辑关系的能力。换句话说,我们训练的可能并不是“听到了多少”,而是当一段陌生而复杂的信息不断进入耳朵的时候,大脑能不能一直保持工作以及长时间的活跃,并把信息接收到位。
重温了东野圭吾的《放学后》,距我第一次看已经过去了七八年的时间了吧。仍然无法理解凶手的动机,青春期的女生真是一个谜啊。最近在阅读东野圭吾的经典作品,包括《假面山庄》、《秘密》、《从前我死去的家》,这些都是新读的作品。在 BiliBili 上也在开车通勤时听完了《白夜行》、《嫌疑人 X 的献身》、《红手指》以及《我杀了他》,前两本是重温,后两本是第一次听。听书的过程是非常奇妙的,奇妙的地方在于你知道一个名字的读法,但是你完全不知道是哪两个字。在你第一次听到人物名字的时候,你或许会在头脑里默默给这个人的名字赋予一种写法,但是随着案件的展开,等你对这个人物有了更深入的认识,你可能会有一种想法就是“那我感觉这个人的名字还是换成这两个字更恰当”,这个人物的名字会随着故事而变来变去。但是当你真的听完了,打开书以后,再一看,你会发现这些人物你似乎都不认识,再仔细一看,原来是作者给同样读音的名字选用了完全不同的写法。现在正在重读 《幻夜》和《沉默的巡游》,没错,双线程读书 LoL,基本上就是打开两个 Apple Read 的窗口,每次随机打开哪个就读哪个。上边所有作品中,后劲最大的还是《秘密》,虽然半路能猜到结局,但是真的读到的最后一个小节还是会忍不住深深的叹息,你会期待“不要这样不要这样”,但是如果真的没有发生,你又会纠结“如果不要这样,那又该怎样呢”?
大概是两个月前,公司内外都疯传一个文章,https://dontpastetheai.com/, 大概意思就是,当你的同事问你一个问题的时候,你不应该直接把一段 AI Agent 的回复粘贴给他/她,人写的一个小而美的回答总是更有益的。“要是我想要一个 AI 的回答,我何苦去问你,我还不如自己去问 AI”。突然每个人都在转发这个 link,就好像所有人都积怨已深,所有人都是受害者。我没有转发,因为我不赞同,但是我也没有直接指出来。究其原因,一方面是因为我这么做好像是在为自己辩驳,反而做实了我整天“无脑把 AI 的 output 丢给同事”的形象;另一方面自然是我也不想在大家正在兴头上的时候给大家泼冷水,显得自己很独特。但是现在两个月过去了,我决定说一说我的想法。
所有人都在用 AI,但是同样的模型给不同的人用,效果是不一样的。虽然有些没礼貌,但是我这里说的意思的确是:有的人确实不会用 Agent。他们还在把 Agent 当成 ChatBot 去用,MCP 也没有 setup,memory 也不会管理,也没有 customized skills,但是对外还是宣称自己是 AI Native。自 AI Agent 概念提出以来,先后经历了 prompt engineer,context engineer,还有现在的 harness engineer,其核心思想都是:我们怎么样给我们的 Agent 以最准确的、全面、详细的信息和指令。但是,就同一个问题而言,你的 Agent 和我的 Agent 能从用户手里拿到的context 是不一样的,大家的“用法”不一样,所以能从 Agent 那里拿到的结果也几乎可以肯定是不一样的。
所以 “我要是想要一个AI的回答,我何苦去问你,我还不如自己去问 AI” 几乎可以肯定是一个伪命题。大概率是,一个人已经问过 AI 了,AI 缺少想要的信息无法给出准确的回答,或者 AI 给出的回答是错误的,无法找到问题的根因,所以他/她才去问别人。所以,并不能仅仅依靠“同事给我的是来自AI的回答”这一点就否定这个回答的意义。
事实上,你的 AI 我的 AI 确实“不一样”。
相反得,如果你需要的是某个问题的 context,那么你更需要来自 AI 全面的分析和细节的处理,这些很有可能是你的同事本人都无法给出的。
我曾经给团队的一个 project 做过一个大 feature,这个 feature 花了我大概一个月的时间,前后遇到了各种各样的问题,经历了无数测试和重构,才成功merge。当时我手上积攒了无数的 debug 经历、design doc、重新设计的思路、以及看似是 detour 实则有用的 design,而且我更加确信的是,我当时作为那个 feature 的 PoC,未来一定会有人来问我问题。所以我当时就用手上所有资料,让 Claude 做了一个关于这个 feature 的 html,一个 "all you need" website 分享了出去(我也指出了是 AI 写的),可以确定的是,如果任何一个其他的人仅仅依靠一个最强大的 AI Agent 模型去读已经 merge 了的代码,他/她几乎完全不可能得到这个 html 能够提供给你的信息。但是遗憾的是,我刚把这个文档 po 出去,就遇到一个同事的反对,反对的理由很简单,“你这个文档是纯 AI 写的,我一眼都不会看”。我无奈得笑了,我心里想,到了那一天,你的 Agent 可能不会这么想。遗憾的是我们永远都不会知道答案了,因为那个同事在不久后就离职了,当然这两者毫无联系,只是一个有趣的巧合。
我相信肯定不会只有我一个人有上面这种想法,那为什么大家还对一开始我提到的那个文章感同身受呢?我想原因大概率是,当我真正需要同事快速给出一个简单回答的时候,同事没有这么做,反而丢来了一堆 AI 的回复。这里就牵扯到一个问题:在 AI-native 时代需要交流的时候,我们首先需要建立一种沟通机制,这个沟通机制,简单来说就是:
“人对人、AI 对 AI”。
我们在沟通前需要明确这一点,因为这个问题的答案决定了对话的走向。简单来说,提问者在未来有绝对的义务表明,我问你的这个问题,是我需要我个人做判断,还是仅仅需要把你的回答复制粘贴给我的 Agent 。如果是前者,那么就需要回答方来研究、调研、给出一个“人能看懂并且接受”的回答;否则就不要要求对方过多,毕竟大家都很忙,对方调研总结一圈的结果还是被你直接丢进 Agent,岂不是费时又费力。
那么这也就对未来工作产生了一个新的要求,一个人必须要 "know his/her stuff"。人不仅要对 AI 产生的工作负责,同时也要“非常懂”自己提交的内容。这个看起来是废话,但是据我所知,很多公司内部自从引入了 AI Agent 以后,有些人已经对自己产出的东西一无所知了。具体表现为开会的时候“不在线”,问一个问题要很久才能回答(去 query agent 了),以及无法对于一些他工作中比较基础的东西给出明确的反馈(比如你已经做好了的一个feature,大方向上通常有两种做法,方案 A 和方案 B,你选择的是哪种?)。很多人都在想,AI Agent 时代,我怎么样才不会被 AI 代替,那么很显然,做到上方所述的应该是一个最低要求。当然,我写这篇文章的目的更多的是为了分析这种现象以及澄清一些大家应该都同意但是还没人说出来的内在逻辑,而不是抨击某一个流派或者个体。同时,也鼓励大家,在未来真正遇到需要回复 AI 的输出的场合,不要胆怯或者被本文一开始提到的文章所束缚,因为实践才是检验真理的唯一标准。
我感觉,我们正在遭受一场来自于AI的文化入侵,是 AI 对于整个人类的文化入侵。现在AI的训练语料几乎全都来自于,所有存在过的人类的文化积累、写作、和历史,但是真正参与过大模型训练的人都知道,人类历史上所产生的所有语料(低价值的和高价值的),对于训练下一代大模型训练而言,(早就)已经不够用了。但是,AI 却在源源不断得产生文字(甚至是书籍)、图片、视频、音频。过不了多久,互联网上的文字信息中,AI 产生的内容将和人类产生的一样多;再过不了多久,整个互联网的文字语料中,人类产生的文字,就数量而言,将会变成九牛身上的一毛上的毛尖尖(不知道这里会不会也有个摩尔定律,。AI 看似在提供选择,但其实在培养人的习惯。对于人类的大多数而言,在不久的将来,遇到任何正式的书写场合,大家就会从现在的不想写、到不会写、到最后的不敢写。不会写是因为 AI 在无形中吞噬人类组织(复杂)语言的能力、当你只需要给出关键词,AI 就能将大量看起来精心雕琢的段落送到你面前的时候,你是不会再去想遣词造句、因果逻辑、起承转合等等细节的。不敢写是因为害怕出丑或者害怕无法与其他使用AI的人竞争。如果别人用AI半天能写完100页,你自己写一天才能写 2 页,可能出于外部压力,你不得不用 AI,也不敢不用 AI。
我还记得 2022 年我刚开始读博的时候,写一篇论文需要非常大的前期准备工作,主要是一点一点得整理思路的过程。当时,写论文就像拍电影一样,在真正开写之前,我们对论文的章节先做规划(大概几个章节,每个章节是做什么的),然后对章节里边的段落进行规划(每个章节分别有几个段落),最后可能大家没想到的是,作为一个非英文母语者,我甚至会对每个段落里边有几句话,每句话分别什么作用进行设计。其实也没有很夸张,一个标准的学术论文里,一个中等长度的自然段,可能也就是五六句话。这里主要进行规划的是“每句话是每句话有什么功能”,就像排兵布阵一样,这里甚至还会有很多写作上的小巧思。比如如果我需要用到欲扬先抑,那么我可能在第一句话就狠狠把之后要贬低(通常是baseline,LoL)的对象先夸上一通、然后设置一个埋伏(通常是第二句话),最后论证这个埋伏,然后引出我们想讨论的问题。这里可能涉及到跨章节的对偶,一些双关语的引用,一些夹杂了个人偏执和情感宣泄的语句(虽然夹带私货并不好),在开始写之前,整个过程可能会修改好几轮。这就和拍电影写脚本、设计分镜一样。但是说这些,这并没有让我当时写的文章,就一定比现在有了 AI 以后写的文章要更好。说实话,可能很大程度上是没有的。但是不同之处在于,我留下来的是创造的过程、逻辑的演化以及自己经过思考以后的独有意思的表达。“我”究竟是谁呢?我现在慢慢觉得,文字表达是一种体现“我”的方式。如果我的每一次发声,都需要经过一次代理,那么“我”还是“我”吗?如果我到最后甚至无法构思一个完整的观点并把它论述出来,那么这个观点还是“我的意思”吗?无论世界哪个国家的人,都对中央权力下的文字审查抱有深深的敌意,但是在未来我们会不会心甘情愿得让 AI 对我们的每一次发声进行审查甚至是改写呢?
我自认写作能力是比较差的,这主要源于阅读量太低。非常惭愧,在上大学之前,我真正从头到尾读完的“课外书”可能不超过五本,唯一有印象的是高中期间读过的林语堂的《京华烟云》、钱钟书的《围城》以及路遥的《平凡的世界》(初中、小学完全没读过其他的)。我现在都觉得不可思议,我甚至在大学前连通俗小说都没正经看几本。这也就导致,我的写作是非常差的,每次高中语文考试,写作文就和便秘一样。但是现在我会强迫自己保持写作的习惯,因为写作和说话不同的地方在于,它能更真实得体现出一个人活过的印记。在 2023 年 ChatGPT 刚刚发布之时,用 AI 其实是一种时髦,我也在不断用 AI 改写我的内容,对于英语不好、中文也不太 OK 的我来说,AI 简直是救星。但是现在回过头再去读当时经由 AI 润色过的博客,还是会时不时尬出一身冷汗。现在,对于没有用过 AI 的人来说,AI 的产出同样自带一种滤镜:AI 是优秀的、是完备的、是先进的、甚至是比人类更不会犯错误的。我当时也这么深深地认为,以至于我经常有了一个完成度很高的文本后,依然会坚定不移得让“AI”帮我“润色”。然后AI不负众望得把我的文章改得面目全非,我才会满意地点击发布。当时的我甚至倍感欣慰,因为我对自己的否认反而造成了一种畸形的期待:这个文本的被 AI 改得越多,质量就一定越好。仔细想想,当时的我已经放弃了完整表达自己观点的权力。所以,如果这件事也发生在了大多数人身上,人类该如何找回文化自信,是我正在思考的问题。我们能否相信,相比于 AI,由人类创造的语言,人类其实能用更好的、更体现个体特点的、也更造福人类未来发展的方式进行表达和传播。当所有人都在使用 AI,都认为 AI 的输出更胜一筹的时候,我们是否还能够勇敢得对 AI 文化霸权说不。
最近越来越多的数学猜想被 AI 证明或证伪,我个人对待此现象的看法是略显悲观的。我个人认为,无论在什么领域、无论 AI 取得何等令人骄傲的成绩,我们都不应该由否定纯人工带来的(AI-Free)进步的意义。或者换句话说,如果在一个行业里,再也没有人“古法手搓”,长期来看这对于这个行业绝对是一个不好的事情。而 AI 对于数学的问题在于,在未来如果有人能“古法手搓”取得重大数学进步,你将再也无法自证“我是没有用AI完成这件事的”;那么当你没法自证的时候,最好的办法就是“同流合污”,反正你也无法取得“AI-Free”这样的credit;那么数学界的“古法手搓派”就会消失,这件事情对于数学界会有什么影响,我不好判断,但是我认为很显然是负面的影响。虽然这么说不合适,但是隐约有一种“劣币驱逐良币”的感觉。另外需要说明的是,不同领域“古法手搓派”的定义和他们的消失给行业带来的都是不同的。因此,你不能用“AI 加速了软件行业的发展,IT 行业再也没有人纯手写代码了,IT 行业还不是一样欣欣向荣” 来反驳我上边的话。况且,IT 行业真的像大家想想的那样欣欣向荣嘛?我们可能也不知道。
我已经受够了AI写的文字,画的图和做的视频了,我几乎在每一个平台上都能看见:小红书、知乎、X、微信公众号甚至是朋友圈???不是,我不懂你们这些分享 paper 的账号,直接把markdown语法的ChatGPT直出的回答粘贴在小红书上是要干嘛?帮我省去一次 call ChatGPT 的额度嘛?你们甚至有看过自己发的东西吗?为什么发朋友圈也要 AI 润色?你是怕你的朋友们看不懂吗?还是害怕觉得在“年度最佳朋友圈评审大会”上评不上奖?