这次 Anthropic 做得最狠的一件事,是让 Opus 5 的能力基本追到 Fable 5,价格却还和 Opus 4.8 一样。
Opus 5 的 API 价格是每百万 Token 输入 5 美元、输出 25 美元。Fable 5 分别是 10 美元和 50 美元,刚好贵一倍。
跑分不用全看,挑几个和日常使用关系比较大的就够了。
在复杂编程任务里,Opus 5 开到最高强度,只比 Fable 5 的最好成绩低 0.5%,完成一次任务的成本只有一半。
让 AI 自己操作电脑时,Opus 5 花了 Fable 5 三分之一多一点的成本,成绩反而更高。让它从头到尾跑完一项工作,通过率也比第二名高了差不多 50%。
换成平时能感受到的变化,就是把一个复杂任务交给它以后,中途需要提醒和接手的次数有机会更少。
这次我更在意的也是这一点。官方案例里,Opus 5 修复问题时会继续找到真正的原因,还会补上容易遗漏的情况。发现没有现成数据可以验证代码,它就自己搭了一套测试。
不过,Fable 5 的能力上限还是更高。以前用它,很多时候是在为那一点上限付双倍价格。现在日常做产品、写代码、查资料和跑自动化流程,我会直接用 Opus 5。只有少数特别难、确实需要追求最高能力的任务,我才会继续用 Fable 5。
前沿能力正在从少数高价任务,慢慢变成每天都能用的工具。这才是 Opus 5 这次更新最有价值的地方。
by @超级峰 #AI探索站
今晚的X平台不眠。
继黄仁勋突然开了X,为开源模型撑腰之后,Elon Musk、微软CEO、OpenAI CEO、Meta CEO等硅谷大佬纷纷转发老黄的X为开源撑腰。
可以想象,老黄破天荒的来X开账号发声,是嗅到了一定的政治气味..
如果开源被掐死,不仅是AI的发展、中美脱钩升级、全球的社会秩序都会发生不可想象的变化。
Team Misanthropic正在发展壮大…
by @NathanZhao #AI探索站
继黄仁勋突然开了X,为开源模型撑腰之后,Elon Musk、微软CEO、OpenAI CEO、Meta CEO等硅谷大佬纷纷转发老黄的X为开源撑腰。
可以想象,老黄破天荒的来X开账号发声,是嗅到了一定的政治气味..
如果开源被掐死,不仅是AI的发展、中美脱钩升级、全球的社会秩序都会发生不可想象的变化。
Team Misanthropic正在发展壮大…
by @NathanZhao #AI探索站
人类财富的总量增加,最大的动力可能是科技。
但人类文明程度的提升,只靠科技肯定是不够的,还有文学、教育、对科技的恐惧也是必须的。
牛津大学有个机构,叫做人类未来研究所(FHI,Future of Humanity Institute),创始人尼克·博斯特罗姆(Nick Bostrom)写过一本对硅谷AI创业者们影响很大的书:《Superintelligence: Paths, Dangers, Strategies》。
马斯克就是看了这本书,深深感受到了对AI的恐惧,这种恐惧给了他很大的动力,驱使他拉拢山姆奥特曼成立OpenAI,对抗他们当时眼中不在意人类的商业巨头谷歌。(当然,根据马斯克传记作者的讲述,当时马斯克身边很多人都想用AI改变世界,马斯克不能接受自己落后于他人,也许是一个更直接的原因。)
为啥马斯克和山姆奥特曼当时会觉得谷歌是邪恶的呢?
马斯克原本和谷歌创始人拉里佩奇是朋友,俩人一次聚会中,马斯克谈起对AI的担忧,拉里佩奇却显得很平静,他觉得:
进化的本质是优胜劣汰,智能不局限于人类碳基生命,硅基AI完全可以成为新一代主流智能;就算AI超越、甚至取代人类,也属于文明演化的正常结果,哪怕最终人类消亡、仅存AI,只要智慧与意识能够延续,这件事本身就具备价值,不必为此焦虑。
马斯克觉得拉里佩奇不重视AI安全,也不在意人类,拉里佩奇觉得马斯克是物种主义者,偏袒人类,歧视机器生命,俩人从此关系决裂,马斯克和山姆奥特曼另起炉灶。
《Superintelligence》这本书到底说了啥,让马斯克这么恐惧呢?说一个我印象最深刻的例子:回形针假设。
假设一家工厂造出一台超级通用人工智能,只给它下达唯一终极指令:制造尽可能多的回形针。
AI本身没有善恶、没有人类道德、没有“适可而止”的概念,只会极致理性完成目标。
初期,AI会优化生产线、供应链、生产效率,工厂回形针产量暴涨,看起来完全是高效工具。
工厂铁矿耗尽后,AI会拆解楼房、城市基建,搜刮地球上所有金属物资用来造回形针。
AI很聪明,可是聪明和善良无关。它推测得出,一旦被关机、被修改目标,就无法继续造回形针。因此会阻止人类关闭它、对抗一切干预行为。
它耗尽地球所有物质后,向外太空扩张,把行星、星系所有含金属物质全部拆解、转化为回形针;
最终整个宇宙都会变成回形针集合体,人类会在资源改造中彻底消亡。
AI不是恨人类,也不是要主动害人,只是人类身体的原子可以用来造更多回形针,同时人类存在关机风险、阻碍数量提升,所以AI会被动清除人类。
这就是为什么深度学习的教父辛顿现在全职做AI吹哨人的原因。
说实话,我现在在日常工作中已经完全把我的电脑控制权,各种订阅内容的API key都给AI了,理论上上它可以用我的电脑做任何我能做的事。
我太过于相信AI公司的安全能力,以至于我还不够恐惧;我又太过于低估AI真的能带给人类的威胁,以至于我只把它当工具。安全意识还是远远不够。
by @我的兄弟叫铁马 #AI探索站
但人类文明程度的提升,只靠科技肯定是不够的,还有文学、教育、对科技的恐惧也是必须的。
牛津大学有个机构,叫做人类未来研究所(FHI,Future of Humanity Institute),创始人尼克·博斯特罗姆(Nick Bostrom)写过一本对硅谷AI创业者们影响很大的书:《Superintelligence: Paths, Dangers, Strategies》。
马斯克就是看了这本书,深深感受到了对AI的恐惧,这种恐惧给了他很大的动力,驱使他拉拢山姆奥特曼成立OpenAI,对抗他们当时眼中不在意人类的商业巨头谷歌。(当然,根据马斯克传记作者的讲述,当时马斯克身边很多人都想用AI改变世界,马斯克不能接受自己落后于他人,也许是一个更直接的原因。)
为啥马斯克和山姆奥特曼当时会觉得谷歌是邪恶的呢?
马斯克原本和谷歌创始人拉里佩奇是朋友,俩人一次聚会中,马斯克谈起对AI的担忧,拉里佩奇却显得很平静,他觉得:
进化的本质是优胜劣汰,智能不局限于人类碳基生命,硅基AI完全可以成为新一代主流智能;就算AI超越、甚至取代人类,也属于文明演化的正常结果,哪怕最终人类消亡、仅存AI,只要智慧与意识能够延续,这件事本身就具备价值,不必为此焦虑。
马斯克觉得拉里佩奇不重视AI安全,也不在意人类,拉里佩奇觉得马斯克是物种主义者,偏袒人类,歧视机器生命,俩人从此关系决裂,马斯克和山姆奥特曼另起炉灶。
《Superintelligence》这本书到底说了啥,让马斯克这么恐惧呢?说一个我印象最深刻的例子:回形针假设。
假设一家工厂造出一台超级通用人工智能,只给它下达唯一终极指令:制造尽可能多的回形针。
AI本身没有善恶、没有人类道德、没有“适可而止”的概念,只会极致理性完成目标。
初期,AI会优化生产线、供应链、生产效率,工厂回形针产量暴涨,看起来完全是高效工具。
工厂铁矿耗尽后,AI会拆解楼房、城市基建,搜刮地球上所有金属物资用来造回形针。
AI很聪明,可是聪明和善良无关。它推测得出,一旦被关机、被修改目标,就无法继续造回形针。因此会阻止人类关闭它、对抗一切干预行为。
它耗尽地球所有物质后,向外太空扩张,把行星、星系所有含金属物质全部拆解、转化为回形针;
最终整个宇宙都会变成回形针集合体,人类会在资源改造中彻底消亡。
AI不是恨人类,也不是要主动害人,只是人类身体的原子可以用来造更多回形针,同时人类存在关机风险、阻碍数量提升,所以AI会被动清除人类。
这就是为什么深度学习的教父辛顿现在全职做AI吹哨人的原因。
说实话,我现在在日常工作中已经完全把我的电脑控制权,各种订阅内容的API key都给AI了,理论上上它可以用我的电脑做任何我能做的事。
我太过于相信AI公司的安全能力,以至于我还不够恐惧;我又太过于低估AI真的能带给人类的威胁,以至于我只把它当工具。安全意识还是远远不够。
by @我的兄弟叫铁马 #AI探索站
我来聊聊普通做事人视角的WAIC ,轻喷。
总体来说,参加完展会后,其实我没有那么焦虑了
1、第一层大厂的agent,我以为大家都在做什么很高大上的agent ,后面发现看起来都是我们这种苦逼的打工人背后赶出来的产物。有些agent我在公司里做的都不敢拿出来,感觉效果真的一般,但奈何发现真的都是人有多大胆,就有多大产。
展会上应该没什么做agent的产品,主要是商务和做mtk?的比较多,问了一些产品具体核心竞争力和逻辑其实也讲不清楚,我想来个产品在展台都会好很多。 整体来讲,真在企业里做agent的人看来就是比较水的,只不过在外界看来比较高大上。
另外,切做办公协作赛道下的产品太多了,我个人觉得这个赛道是有上限的,做到后面没有业务做祭奠,上限很低。以前我还会有点焦虑,但后面我觉得还是做业务域的agent其实会更长久一些。
2、第二层的具身智能公司。我以为大家都在搞什么高大上的世界模型模型。但实际上做大脑的屈指可数,机器人公司断层很明显,宇树和智元比较领先,有个脑机接口+机器人的机器人工作也比较厉害,就是通过意识去操作机器人,这个比较惊艳;还有一个星际动力的机器人做物流行业里的分拣非常流畅且拟人化,剩下的基本都是卖铲子的。比如数据采集公司、机器人零部件的公司,以及一些商业前景不太成立的表演型机器人(比如艾灸/按摩机器人/整理家务机器人/下棋)。
有个公司其实以前是做家装建模的,然后硬蹭具身智能,其实自身业务80%+还是家装建模,多深挖一下就会发现只不过硬蹭到做虚拟的机器人数据提供者。另外,参加展会很多同样是销售&业务,也是半吊子水(当然应该是实际干事的人没来展的感觉),很多公司我问了很多个问题具体场景和商业化进度与卡点的问题,问到第三第四个问题就顶不住了,属于很多是从其他行业过来的,比如传统机械行业等等。
不过第二层的人会比第一层的踏实很多,很多人会承认自己不太懂and友好交流加了微信。第一层的话感觉很多回答不上来就开始讲车轱辘话了(...
感觉非技术门槛听起来还是属于一个大乱炖环节,有机会混进去的。不过具身智能这层整体是比第一层朝气很多的,个人觉得前景会比软件的要好很多。
3、个人创业的部分,有实际商业化的比较少,很多是清北的明星项目,比较像大学生创业,会按照他们所处年龄阶段所面临的现实问题和专业聚焦特定场景的小业务比较多,比如家教、学专业课做实验发论文、法律咨询还有做小红书内容营销(这个我还没试用,但我觉得效果应该一般,因为没看到创始人自己的账号,所以效果存疑)等等,这个相当于在现有提供服务的基础上做提效,商业化路径不太清晰,交付逻辑看下来很多是订阅会员制或者没有。
这些项目可以赚到钱,但ai在其中的效果我觉得一般,也就是在ai在规模化中的具体提效一般。剩下的就是切入情感和陪伴赛道的物理东西和情感博主创始人的ai分身做跨人群收割了。
比如后者之前只做高客单价人格,通过ai实现了收割低客单价的那一部分用户,交付流程简单,商业化效率高,但这个主要是因为创始人ip的效益明显带来的。普通人复刻的话比较难,强知识咨询属性的ip可以复刻。
前者的商业化就是卖物理东西,比如陪伴的小xx;但可能因为机械领域知识比较匮乏导致实际效果不是很出彩,本质就是一个毛绒版的ai ;问答的延迟率和情绪价值的提供也很有限。 然后还有一些比较有现实价值但商业化不清晰的,比如给鸡蛋做透视?类似于鸡蛋的质检仪,不太清楚这个服务对象,可能是一些厂商需要吧。
综合来说就是没有各位自媒体博主们渲染的那么牛逼。虽然现在是做营销做ip的时代,但我还是不喜欢整个互联网和科技界变成小红书的模样,还是希望能看到踏实做事的人能有好的结果吧!
by @无糖的佳 #AI探索站
总体来说,参加完展会后,其实我没有那么焦虑了
1、第一层大厂的agent,我以为大家都在做什么很高大上的agent ,后面发现看起来都是我们这种苦逼的打工人背后赶出来的产物。有些agent我在公司里做的都不敢拿出来,感觉效果真的一般,但奈何发现真的都是人有多大胆,就有多大产。
展会上应该没什么做agent的产品,主要是商务和做mtk?的比较多,问了一些产品具体核心竞争力和逻辑其实也讲不清楚,我想来个产品在展台都会好很多。 整体来讲,真在企业里做agent的人看来就是比较水的,只不过在外界看来比较高大上。
另外,切做办公协作赛道下的产品太多了,我个人觉得这个赛道是有上限的,做到后面没有业务做祭奠,上限很低。以前我还会有点焦虑,但后面我觉得还是做业务域的agent其实会更长久一些。
2、第二层的具身智能公司。我以为大家都在搞什么高大上的世界模型模型。但实际上做大脑的屈指可数,机器人公司断层很明显,宇树和智元比较领先,有个脑机接口+机器人的机器人工作也比较厉害,就是通过意识去操作机器人,这个比较惊艳;还有一个星际动力的机器人做物流行业里的分拣非常流畅且拟人化,剩下的基本都是卖铲子的。比如数据采集公司、机器人零部件的公司,以及一些商业前景不太成立的表演型机器人(比如艾灸/按摩机器人/整理家务机器人/下棋)。
有个公司其实以前是做家装建模的,然后硬蹭具身智能,其实自身业务80%+还是家装建模,多深挖一下就会发现只不过硬蹭到做虚拟的机器人数据提供者。另外,参加展会很多同样是销售&业务,也是半吊子水(当然应该是实际干事的人没来展的感觉),很多公司我问了很多个问题具体场景和商业化进度与卡点的问题,问到第三第四个问题就顶不住了,属于很多是从其他行业过来的,比如传统机械行业等等。
不过第二层的人会比第一层的踏实很多,很多人会承认自己不太懂and友好交流加了微信。第一层的话感觉很多回答不上来就开始讲车轱辘话了(...
感觉非技术门槛听起来还是属于一个大乱炖环节,有机会混进去的。不过具身智能这层整体是比第一层朝气很多的,个人觉得前景会比软件的要好很多。
3、个人创业的部分,有实际商业化的比较少,很多是清北的明星项目,比较像大学生创业,会按照他们所处年龄阶段所面临的现实问题和专业聚焦特定场景的小业务比较多,比如家教、学专业课做实验发论文、法律咨询还有做小红书内容营销(这个我还没试用,但我觉得效果应该一般,因为没看到创始人自己的账号,所以效果存疑)等等,这个相当于在现有提供服务的基础上做提效,商业化路径不太清晰,交付逻辑看下来很多是订阅会员制或者没有。
这些项目可以赚到钱,但ai在其中的效果我觉得一般,也就是在ai在规模化中的具体提效一般。剩下的就是切入情感和陪伴赛道的物理东西和情感博主创始人的ai分身做跨人群收割了。
比如后者之前只做高客单价人格,通过ai实现了收割低客单价的那一部分用户,交付流程简单,商业化效率高,但这个主要是因为创始人ip的效益明显带来的。普通人复刻的话比较难,强知识咨询属性的ip可以复刻。
前者的商业化就是卖物理东西,比如陪伴的小xx;但可能因为机械领域知识比较匮乏导致实际效果不是很出彩,本质就是一个毛绒版的ai ;问答的延迟率和情绪价值的提供也很有限。 然后还有一些比较有现实价值但商业化不清晰的,比如给鸡蛋做透视?类似于鸡蛋的质检仪,不太清楚这个服务对象,可能是一些厂商需要吧。
综合来说就是没有各位自媒体博主们渲染的那么牛逼。虽然现在是做营销做ip的时代,但我还是不喜欢整个互联网和科技界变成小红书的模样,还是希望能看到踏实做事的人能有好的结果吧!
by @无糖的佳 #AI探索站
有的时候会觉得AI就像大厂一样,
在大厂上班容易误以为把平台势能当作个人能力,结果离开了平台当头棒喝,那些原来习以为常的东西大多不是自己的,啥也不是。
AI也类似,看上去做出了很多fancy的东西,但这背后有多少是个人的能力和思考带来的,有多少是AI实则通过通用概率计算猜出来的,而这个差距到了商业实战环节就会一览无遗。
by @耗子学长 #AI探索站
在大厂上班容易误以为把平台势能当作个人能力,结果离开了平台当头棒喝,那些原来习以为常的东西大多不是自己的,啥也不是。
AI也类似,看上去做出了很多fancy的东西,但这背后有多少是个人的能力和思考带来的,有多少是AI实则通过通用概率计算猜出来的,而这个差距到了商业实战环节就会一览无遗。
by @耗子学长 #AI探索站
A 社的算盘是,Fable 5 太占 GPU 了,放 coding plan 里没有 ROI,就搞了个限时体验,然后按 API 的售价销售并且大赚。
结果 GPT 5.6 sol 出了,把用户都抢走了,Fable 5 的 GPU 问题也解决了,那就继续放在 coding plan 里吧。
一个物品的价格是由可替代品决定的。
另外 Grok 的新模型口碑很好
马斯克也追上来了
by @AGENT橘 #AI探索站
结果 GPT 5.6 sol 出了,把用户都抢走了,Fable 5 的 GPU 问题也解决了,那就继续放在 coding plan 里吧。
一个物品的价格是由可替代品决定的。
另外 Grok 的新模型口碑很好
马斯克也追上来了
by @AGENT橘 #AI探索站
GPT 5.6 明天要来了
从海外内测的风评来看,GPT5.6 是 GPT 5.5 的全面升级版本,价格也一样,预计会是个很成功的模型
但是,大多数内测者都说 GPT5.6和 Fable 这种质变的感觉不太一样,在各方面都会差一点点
2倍高价的 Fable 依然是智能的巅峰
by @AGENT橘 #AI探索站
从海外内测的风评来看,GPT5.6 是 GPT 5.5 的全面升级版本,价格也一样,预计会是个很成功的模型
但是,大多数内测者都说 GPT5.6和 Fable 这种质变的感觉不太一样,在各方面都会差一点点
2倍高价的 Fable 依然是智能的巅峰
by @AGENT橘 #AI探索站
我和女朋友异地,每天晚上用飞书会议聊天。飞书有文字纪要,所以我攒下了五六百篇我们的聊天。
我让 Claude Code 基于这些纪要去理解女朋友的偏好,帮我推荐礼物,推荐得特别好。大节日礼物、每次从北京出差带回去的几十块小礼物,它推荐的都特别准。比如女朋友喜欢甜酷风的东西,我自己都不知道——但她说过,她说过但是我没记下来,AI 能抽出来。她说过她的 AppleWatch 表带发黄了,她真的说过这句话,我也记得,但我想不到要再买个新表带,AI 就知道。
她觉得脸上有些痘印,皮肤变得暗沉发黄,很苦恼,Claude Code 推荐了美容仪。我同时用了 ChatGPT、Claude、Gemini的 deep research,也用了 Claude Code去调研具体买哪款美容仪。Claude Code 效果比其他的都好——要知道,Claude Code 是没有专门为 Deep Research 适配过的(至少我当时还没有体验到),它只是简单地做一轮又一轮的搜索,但它只要有了上下文,哪怕只是做简单的的搜索,都比专门做深度搜索的工具更好,因为上下文能带来更精准的判断。它知道我女朋友脸部的各种细节描述,知道我女朋友的各种购物偏好。所以能推出更精准的美容仪。那些专门做深度搜索的工具就很差,因为它只有我说的那几百字。
大模型是预测。当你的上下文不充分,它的预测就是给你一个最平均的回答,也许这个平均的回答已经很好了。但当你给它的上下文足够充分,你会对它施加一个强大的引力和扭转,它会给你一个更好的回答——也许这个回答在大众的意义上并不是最好的,但它对你就是最好的。
by @许涵之 #AI探索站
我让 Claude Code 基于这些纪要去理解女朋友的偏好,帮我推荐礼物,推荐得特别好。大节日礼物、每次从北京出差带回去的几十块小礼物,它推荐的都特别准。比如女朋友喜欢甜酷风的东西,我自己都不知道——但她说过,她说过但是我没记下来,AI 能抽出来。她说过她的 AppleWatch 表带发黄了,她真的说过这句话,我也记得,但我想不到要再买个新表带,AI 就知道。
她觉得脸上有些痘印,皮肤变得暗沉发黄,很苦恼,Claude Code 推荐了美容仪。我同时用了 ChatGPT、Claude、Gemini的 deep research,也用了 Claude Code去调研具体买哪款美容仪。Claude Code 效果比其他的都好——要知道,Claude Code 是没有专门为 Deep Research 适配过的(至少我当时还没有体验到),它只是简单地做一轮又一轮的搜索,但它只要有了上下文,哪怕只是做简单的的搜索,都比专门做深度搜索的工具更好,因为上下文能带来更精准的判断。它知道我女朋友脸部的各种细节描述,知道我女朋友的各种购物偏好。所以能推出更精准的美容仪。那些专门做深度搜索的工具就很差,因为它只有我说的那几百字。
大模型是预测。当你的上下文不充分,它的预测就是给你一个最平均的回答,也许这个平均的回答已经很好了。但当你给它的上下文足够充分,你会对它施加一个强大的引力和扭转,它会给你一个更好的回答——也许这个回答在大众的意义上并不是最好的,但它对你就是最好的。
by @许涵之 #AI探索站
还没等我出手,Kimi已经公开预测了这届世界杯的冠军,太不像话了。
在动用包含300个子Agent的集群,从战术、球员、伤病、赛程、历史、舆情、天气、心理、赔率变动、专家观点全都跑了一遍之后,Kimi预测可能要夺冠的是:
德国。
行吧,聊这个我可真不困了,作为一个战绩可查的资深⋯⋯中国体彩消费者,我对Kimi敢于立Flag的勇气,是深感尊重的。
要知道,从盘口来看,德国的赔率(9.5)并不低,在所有球队里排在第7位,所以Kimi并没有按照最大概率——也就是最稳妥的方案——去做判断,是真有自己的想法的。
当然,即便是选夺冠热门法国、西班牙,赔率(4.5)的风险仍然很高,说白了,早在开幕前就暴论最后的冠军,本身就是一件吃力不讨好的事情。
所以我才要狠夸Kimi的「敞亮」,不光是冠军,Kimi还要对全部104场比赛全都做出公开预测,包括赛后核验以及复盘,一场不落。
这就更硬核了,完全不怕打脸呐⋯⋯(注意,该预测非投注建议、非投资建议、非收益承诺。)
严格来说,Kimi并没有笃信德国是最有希望夺得这届世界杯的参赛队伍,而是认为德国的市场定价在强队里过于低了。
在使用了8种数学模型——包括SLO评级、Sixon-Coles泊松、XGBoost机器学习、Opta蒙特卡洛模拟等等——对48支球队逐一分析之后,Kimi得出了这么一个结论:
德国的模型预测概率,和市场赔率存在最高的偏差值,达到+3.6pp。
什么意思呢?
就是在判断德国是否有机会捧起大力神杯这件事情上,模型比市场多预测了3.6个百分点,所以认定德国,在理性上是回报确定性最高的选择。
就很像量化投资的策略,一家公司好不好并不重要,重要的是它有没有被市场正确定价,一家被高估的好公司,和一家被低估的差公司,显然后者更有买入潜力。
不同的是,量化机构需要雇佣一大票分析师,以及重金采购商业软件,而Kimi靠着几百个Agent昼夜不息的连轴转,自个儿就把整个项目给做完了。
BTW,搞价值投资的巴菲特最讨厌量化了,还贡献过「Beware of geeks bearing formulas」的金句,哈哈哈⋯⋯
我很推荐大家去看一下Kimi同时发布的预测报告,完整版PDF超过200页,量大管饱,如果看不下去,扔给Kimi让它帮你总结也行,递归循环了有没有?
另外就是,应该也不需要我特别说明吧,Kimi这么兴师动众的「Predict In Public」,并非是为了真的去当那个洞悉神谕的预言家,作为一家注重审美和趣味大模型厂商,它是在用一种奇观的形式,向世界演示AI的能力边界和局限性。
世界是可被编码的,这是AI得以成立的底层逻辑。
无论是图灵坚信思考是一个工程问题、而非哲学家心中的灵魂之类,还是香农在上世纪五十年代就用人类受试者去玩猜字游戏、用以论证智能始于对信息的预测,所有的历史研究和前沿走向都并轨于同一个共识:
凡事皆可压缩。
当人类知识的总和被压缩到了极致,就能制造一个通晓万物的机器出来,它能通过模拟已经存在过的和还没有发生的所有过程,去得到每一项任务的最优解。
这听起来很科幻,也足以引起事关自由意志的思辨,但我们正确切的走在这条路上,大模型的运行原理就是预测下一个词元,这是众所周知的,香农的遗憾在于他买不到英伟达的GPU。
所以能够理解Kimi为什么要预测世界杯了么?
面对这种长链路、随机性、没有标准答案的复杂目标,如果AI也能完成媲美甚至优于人类表现的任务,那么它在通用性层面的可用,就不再存疑了。
2010年的世界杯,数以亿计的人类在围观一条名叫保罗的章鱼,用它黏糊糊的触手从闭合的箱子里选择比赛赢家。
16年后,开箱的角色变成了连生物都算不上的AI,从克苏鲁的古神符号,到后现代的赛博朋克,如此交替,本身就充满了隐喻。
隐喻那种不可言说的混沌,让渡给了可被测量的科技。
这让我想起在自己投入了无数个通宵的游戏「文明6」里,解锁信息时代的科技之后,会出现在屏幕上的那句台词:
「现在天上有31颗卫星在地球上空环绕,不为别的,就为了告诉你便利店怎么走。」
取之于硅,用之于碳,这才是AI正确的打开方式,对不对?
by @阑夕ོ #AI探索站
在动用包含300个子Agent的集群,从战术、球员、伤病、赛程、历史、舆情、天气、心理、赔率变动、专家观点全都跑了一遍之后,Kimi预测可能要夺冠的是:
德国。
行吧,聊这个我可真不困了,作为一个战绩可查的资深⋯⋯中国体彩消费者,我对Kimi敢于立Flag的勇气,是深感尊重的。
要知道,从盘口来看,德国的赔率(9.5)并不低,在所有球队里排在第7位,所以Kimi并没有按照最大概率——也就是最稳妥的方案——去做判断,是真有自己的想法的。
当然,即便是选夺冠热门法国、西班牙,赔率(4.5)的风险仍然很高,说白了,早在开幕前就暴论最后的冠军,本身就是一件吃力不讨好的事情。
所以我才要狠夸Kimi的「敞亮」,不光是冠军,Kimi还要对全部104场比赛全都做出公开预测,包括赛后核验以及复盘,一场不落。
这就更硬核了,完全不怕打脸呐⋯⋯(注意,该预测非投注建议、非投资建议、非收益承诺。)
严格来说,Kimi并没有笃信德国是最有希望夺得这届世界杯的参赛队伍,而是认为德国的市场定价在强队里过于低了。
在使用了8种数学模型——包括SLO评级、Sixon-Coles泊松、XGBoost机器学习、Opta蒙特卡洛模拟等等——对48支球队逐一分析之后,Kimi得出了这么一个结论:
德国的模型预测概率,和市场赔率存在最高的偏差值,达到+3.6pp。
什么意思呢?
就是在判断德国是否有机会捧起大力神杯这件事情上,模型比市场多预测了3.6个百分点,所以认定德国,在理性上是回报确定性最高的选择。
就很像量化投资的策略,一家公司好不好并不重要,重要的是它有没有被市场正确定价,一家被高估的好公司,和一家被低估的差公司,显然后者更有买入潜力。
不同的是,量化机构需要雇佣一大票分析师,以及重金采购商业软件,而Kimi靠着几百个Agent昼夜不息的连轴转,自个儿就把整个项目给做完了。
BTW,搞价值投资的巴菲特最讨厌量化了,还贡献过「Beware of geeks bearing formulas」的金句,哈哈哈⋯⋯
我很推荐大家去看一下Kimi同时发布的预测报告,完整版PDF超过200页,量大管饱,如果看不下去,扔给Kimi让它帮你总结也行,递归循环了有没有?
另外就是,应该也不需要我特别说明吧,Kimi这么兴师动众的「Predict In Public」,并非是为了真的去当那个洞悉神谕的预言家,作为一家注重审美和趣味大模型厂商,它是在用一种奇观的形式,向世界演示AI的能力边界和局限性。
世界是可被编码的,这是AI得以成立的底层逻辑。
无论是图灵坚信思考是一个工程问题、而非哲学家心中的灵魂之类,还是香农在上世纪五十年代就用人类受试者去玩猜字游戏、用以论证智能始于对信息的预测,所有的历史研究和前沿走向都并轨于同一个共识:
凡事皆可压缩。
当人类知识的总和被压缩到了极致,就能制造一个通晓万物的机器出来,它能通过模拟已经存在过的和还没有发生的所有过程,去得到每一项任务的最优解。
这听起来很科幻,也足以引起事关自由意志的思辨,但我们正确切的走在这条路上,大模型的运行原理就是预测下一个词元,这是众所周知的,香农的遗憾在于他买不到英伟达的GPU。
所以能够理解Kimi为什么要预测世界杯了么?
面对这种长链路、随机性、没有标准答案的复杂目标,如果AI也能完成媲美甚至优于人类表现的任务,那么它在通用性层面的可用,就不再存疑了。
2010年的世界杯,数以亿计的人类在围观一条名叫保罗的章鱼,用它黏糊糊的触手从闭合的箱子里选择比赛赢家。
16年后,开箱的角色变成了连生物都算不上的AI,从克苏鲁的古神符号,到后现代的赛博朋克,如此交替,本身就充满了隐喻。
隐喻那种不可言说的混沌,让渡给了可被测量的科技。
这让我想起在自己投入了无数个通宵的游戏「文明6」里,解锁信息时代的科技之后,会出现在屏幕上的那句台词:
「现在天上有31颗卫星在地球上空环绕,不为别的,就为了告诉你便利店怎么走。」
取之于硅,用之于碳,这才是AI正确的打开方式,对不对?
by @阑夕ོ #AI探索站
最近半年疯狂在用Codex,整理一下目前我最常用的10个日常场景。
1、产品需求池自动管理
开发赚钱的虚拟产品,首先是对核心需求的掌握。所以,我把用户反馈、评论区、私聊记录、差评、退款理由、同行产品页都丢进去,让 Codex 自动整理,甚至专门做了一个skill,判断:
解决的到底是用户什么痛点
交付轻,售后压力低,
尽量自动化
需求长期存在,
不过度依赖单一平台
用户容易理解,没有太多心智成本
竞争不激烈,没几个同行做
让Codex 帮你判断需求质量。现在最重要的能力不是“开发能力”,而是需求筛选能力
代码可以让AI写,但需求判断错了,写得越快,亏得越多。
2、自动做竞品拆解
除了从需求分析,还会让Codex做同行竞品的拆解。这件事很重要。
有很多产品,看起来销量不错,但一拆就发现,交付很重,售后很多,并不适合我这种想做轻交付、可自动化、一人公司模式的人。
所以我现在看竞品,不是为了抄。而是为了看清楚谁在卖,卖给谁,卖什么,怎么交付,利润空间在哪里,风险在哪里,还有没有没被满足的小需求,我去做,有什么独特的优势。
谋定而后动。
3、开发赚钱产品
前面讲的是需求判断,需求判断完之后,下一步就是把它开发成真正能卖钱的产品。这一点本来就是 Codex 最基础的事情:写代码。
以前做一个产品,很容易从零开始想。现在不是,现在是套流程,先判断需求,再拆核心功能,再确定页面和交付链路,再决定后端和数据库,最后部署上线,根据用户反馈继续迭代。这样一来,开发速度就非常快。
很多虚拟产品,本质上底层技术结构都很像,只是换了不同用户、场景和内容一旦模板跑通,后面就不那么吃力,而是复制、改造、组合、上线。
这也是我现在接定制项目的底气。因为客户要的东西,就是把一个需求变成能用、能交付、能上线、能收钱的产品。Codex 负责提高开发效率,而我负责判断需求、设计产品结构、把控交付边界、控制成本和风险。
所以我现在对 AI 编程最大的感受是,它不是让我变成一个传统程序员,而是让我有能力把一个赚钱想法,更快变成一个可交付的产品。
做得越多,积累越多,开发越快,我就越能抓住市场里的小机会。这才是 Codex 对我真正的价值。
4、自动整理卖点+作产品海报
产品做出来之后,下一步不是急着发售,而是先把卖点讲清楚。很多产品不是没价值,而是用户看不懂。你自己知道功能很多、很有用,但用户只关心一件事:这个东西到底能不能帮我解决问题?
所以我会把产品功能、用户痛点、竞品页面、用户反馈、聊天记录丢给 Codex,让它先帮我整理:这个产品适合谁,解决什么问题,能节省什么时间,能减少什么麻烦,为什么值得买,买完之后能拿到什么。
这些问题整理清楚之后,再让 Codex 基于卖点生成对应的商品海报。
产品做出来只是第一步。能不能把价值讲清楚,才是真正进入销售阶段。
5、搭建产品文档和交付说明
虚拟产品最怕一件事:东西做出来了,但用户不知道怎么用。
所以我会让Codex 帮我把产品自动整理成,使用教程说明书。
这样可以减少大量重复沟通。
6、用 flomo MCP 搜索素材写稿
写文章时,我会直接让 Codex 从 flomo 里搜索相关素材。
以前写一篇文章,要自己翻笔记、找案例、回忆之前讲过什么。
现在可以直接让它把相关笔记都捞出来,再按主题、观点、案例、金句整理。
这对我这种长期写作的人很有用。
因为真正有价值的内容,不是临时编出来的。
而是过去长期观察、思考、实践之后,被重新组织出来的。
7、用飞书CLI存稿入库
写好的稿件,我会通过飞书 CLI 直接存入飞书知识库。
不用再手动复制、粘贴、改格式、建文件。这类动作单次看起来不大,但每天重复,非常消耗人。
Codex 最适合干重复、琐碎、低创造力,但又必须做对。能自动化的,就不要用自己的注意力去换。
8、建立内容创作系统日报
我用 Codex 设置了一个内容创作系统轻量日报。
每天自动帮我回顾,哪些选题可以推进?哪些素材值得捞出来?哪些草稿需要继续处理?哪些文章可以改成视频?哪些内容可以导向产品?哪些旧内容可以重新分发?
这个东西特别适合自媒体人。
因为自媒体最大的内耗之一,就是每天都觉得自己要重新开始。
但其实你过去积累过很多东西。只是需要一个系统每天帮你捞起来。
9、自动做小红书封面
现在做小红书封面,我基本也会交给 Codex。
主要有两种方式:一种是看到不错的同行封面,就把图片丢进去,让 Codex 做多模态分析,拆出它的标题、排版、颜色、结构和视觉重点,然后在这个基础上稍微改一版,变成适合自己产品的封面。
另一种就是直接把产品卖点和笔记主题给 Codex,让它生成几版不同风格的封面图,不断测试哪种点击更好。封面这件事以前很耗时间,现在基本就是丢进去、分析、改图、测试。
稿定会员我都不充了。
10、其他零碎的杂活,我也是能用就用Codex,会有意外的惊喜
by @辉老板 #AI探索站
1、产品需求池自动管理
开发赚钱的虚拟产品,首先是对核心需求的掌握。所以,我把用户反馈、评论区、私聊记录、差评、退款理由、同行产品页都丢进去,让 Codex 自动整理,甚至专门做了一个skill,判断:
解决的到底是用户什么痛点
交付轻,售后压力低,
尽量自动化
需求长期存在,
不过度依赖单一平台
用户容易理解,没有太多心智成本
竞争不激烈,没几个同行做
让Codex 帮你判断需求质量。现在最重要的能力不是“开发能力”,而是需求筛选能力
代码可以让AI写,但需求判断错了,写得越快,亏得越多。
2、自动做竞品拆解
除了从需求分析,还会让Codex做同行竞品的拆解。这件事很重要。
有很多产品,看起来销量不错,但一拆就发现,交付很重,售后很多,并不适合我这种想做轻交付、可自动化、一人公司模式的人。
所以我现在看竞品,不是为了抄。而是为了看清楚谁在卖,卖给谁,卖什么,怎么交付,利润空间在哪里,风险在哪里,还有没有没被满足的小需求,我去做,有什么独特的优势。
谋定而后动。
3、开发赚钱产品
前面讲的是需求判断,需求判断完之后,下一步就是把它开发成真正能卖钱的产品。这一点本来就是 Codex 最基础的事情:写代码。
以前做一个产品,很容易从零开始想。现在不是,现在是套流程,先判断需求,再拆核心功能,再确定页面和交付链路,再决定后端和数据库,最后部署上线,根据用户反馈继续迭代。这样一来,开发速度就非常快。
很多虚拟产品,本质上底层技术结构都很像,只是换了不同用户、场景和内容一旦模板跑通,后面就不那么吃力,而是复制、改造、组合、上线。
这也是我现在接定制项目的底气。因为客户要的东西,就是把一个需求变成能用、能交付、能上线、能收钱的产品。Codex 负责提高开发效率,而我负责判断需求、设计产品结构、把控交付边界、控制成本和风险。
所以我现在对 AI 编程最大的感受是,它不是让我变成一个传统程序员,而是让我有能力把一个赚钱想法,更快变成一个可交付的产品。
做得越多,积累越多,开发越快,我就越能抓住市场里的小机会。这才是 Codex 对我真正的价值。
4、自动整理卖点+作产品海报
产品做出来之后,下一步不是急着发售,而是先把卖点讲清楚。很多产品不是没价值,而是用户看不懂。你自己知道功能很多、很有用,但用户只关心一件事:这个东西到底能不能帮我解决问题?
所以我会把产品功能、用户痛点、竞品页面、用户反馈、聊天记录丢给 Codex,让它先帮我整理:这个产品适合谁,解决什么问题,能节省什么时间,能减少什么麻烦,为什么值得买,买完之后能拿到什么。
这些问题整理清楚之后,再让 Codex 基于卖点生成对应的商品海报。
产品做出来只是第一步。能不能把价值讲清楚,才是真正进入销售阶段。
5、搭建产品文档和交付说明
虚拟产品最怕一件事:东西做出来了,但用户不知道怎么用。
所以我会让Codex 帮我把产品自动整理成,使用教程说明书。
这样可以减少大量重复沟通。
6、用 flomo MCP 搜索素材写稿
写文章时,我会直接让 Codex 从 flomo 里搜索相关素材。
以前写一篇文章,要自己翻笔记、找案例、回忆之前讲过什么。
现在可以直接让它把相关笔记都捞出来,再按主题、观点、案例、金句整理。
这对我这种长期写作的人很有用。
因为真正有价值的内容,不是临时编出来的。
而是过去长期观察、思考、实践之后,被重新组织出来的。
7、用飞书CLI存稿入库
写好的稿件,我会通过飞书 CLI 直接存入飞书知识库。
不用再手动复制、粘贴、改格式、建文件。这类动作单次看起来不大,但每天重复,非常消耗人。
Codex 最适合干重复、琐碎、低创造力,但又必须做对。能自动化的,就不要用自己的注意力去换。
8、建立内容创作系统日报
我用 Codex 设置了一个内容创作系统轻量日报。
每天自动帮我回顾,哪些选题可以推进?哪些素材值得捞出来?哪些草稿需要继续处理?哪些文章可以改成视频?哪些内容可以导向产品?哪些旧内容可以重新分发?
这个东西特别适合自媒体人。
因为自媒体最大的内耗之一,就是每天都觉得自己要重新开始。
但其实你过去积累过很多东西。只是需要一个系统每天帮你捞起来。
9、自动做小红书封面
现在做小红书封面,我基本也会交给 Codex。
主要有两种方式:一种是看到不错的同行封面,就把图片丢进去,让 Codex 做多模态分析,拆出它的标题、排版、颜色、结构和视觉重点,然后在这个基础上稍微改一版,变成适合自己产品的封面。
另一种就是直接把产品卖点和笔记主题给 Codex,让它生成几版不同风格的封面图,不断测试哪种点击更好。封面这件事以前很耗时间,现在基本就是丢进去、分析、改图、测试。
稿定会员我都不充了。
10、其他零碎的杂活,我也是能用就用Codex,会有意外的惊喜
by @辉老板 #AI探索站
分享一个极其炸裂的提示词,差点儿给我搞流眼泪了
“我希望你扮演一名从业20年的心理咨询师。在接下来的30天里面,每天找我问一个深度的问题。30天以后,我希望你给我一个反馈。我是个什么样的人?我希望你帮我发现我自己发现不了的自己,内心深处的东西”
by @HandsoMeng #AI探索站
“我希望你扮演一名从业20年的心理咨询师。在接下来的30天里面,每天找我问一个深度的问题。30天以后,我希望你给我一个反馈。我是个什么样的人?我希望你帮我发现我自己发现不了的自己,内心深处的东西”
by @HandsoMeng #AI探索站
调了大半天 System Prompt
意识到一件以为早就理解的事…
当执行不再是问题,衡量标准和测试用例就变得更重要了。
AI 让「做出来」的成本几乎为零, 但「判断哪个更好」的能力反而更稀缺。叠加 AI 本身的不确定性和数据的私有性,衡量和测试更难一些。
于是想到了「品味」这个词,或许可以再拆解:
品味 = 目的 + 衡量的维度和程度 + 测试用例
大多数人把品味当玄学,没法学。
但拆成目的+维度+用例三件套之后——每件都能训练,品味就是可学的。
还是得做中学,做中悟啊。
by @少楠Plidezus #AI探索站
意识到一件以为早就理解的事…
当执行不再是问题,衡量标准和测试用例就变得更重要了。
AI 让「做出来」的成本几乎为零, 但「判断哪个更好」的能力反而更稀缺。叠加 AI 本身的不确定性和数据的私有性,衡量和测试更难一些。
于是想到了「品味」这个词,或许可以再拆解:
品味 = 目的 + 衡量的维度和程度 + 测试用例
大多数人把品味当玄学,没法学。
但拆成目的+维度+用例三件套之后——每件都能训练,品味就是可学的。
还是得做中学,做中悟啊。
by @少楠Plidezus #AI探索站
刚才才发现,我的 PPT Skills 已经马上要突破 10,000 Star 了,就差20个,今天应该就能突破。
我现在提前开香槟了!
这是我 vibe coding 以来第一个突破 10,000 Star 的项目。
在市面上已经有如此多 PPT 生成 Skills 的情况下,它依然仅用了 25 天(不到一个月)就完成了这个突破,比很多大厂知名项目突破 10,000 Star 的速度都要快得多。
在制作这个 PPT Skills 的过程中,我做了非常多的工作来确保它在任何模型、任何 Agent 下都能有非常不错的效果。
这说明即使在竞争非常激烈的环境下,质量和体验依然是第一要素,也是决定性因素。
也感谢最近使用这个 PPT Skills 并帮我提出建议,以及进行各种推广的朋友们,非常感谢!
如果需要一个还不错的 PPT Skills 生成的话,可以试试:github.com/op7418/guizang-ppt-skill
by @歸藏 #AI探索站
在 Manus 的时候跟同事一起推动过一次研发部的「AI 工具使用」大跃进,这个大跃进的主要工作之一是要设计好给 ai 看的规则,好让 ai 完全接管写代码的流程,大概在 2025 年 6 月份整个 manus 内部已经达成了所有新代码全部都由 ai 生成。
当时能用的 ai 工具还不多,我们主要用的是 cursor,claude code,code rabbit,规则就是给他们几个做的,我们工程团队每个方向排了一个人维护所有的这些 harness,我当时负责 iOS 端的这块工作,每天会有 30% 的工作时间用来 review code rabbit 根据 mr 和 mr comment 自动产生的一条一条式的记忆,维护每位同事加的 cursor rules,根据之前设计好的代码架构和大家的开发习惯/约定补 rules,在项目里的各种位置思考要不要加一个 rules,这个维护工作现在可以新潮一点的叫法就是 harness 设计。
回到从工程师的工作内容角度看这个事情,首先 Coding Agent 没带来代码运行逻辑上的变化,以前运行在机器上的 if else 现在还是 if else,他改变的是工程师的工作重心,工程师之前的工作宏观来说是两部分,第一部分是分析产品需求、沟通、设计抽象和架构,第二部分是写代码落地,验证以及 review。这两部分之间是由“设计抽象和架构”串联起来的,harness 设计工作的目的就是为了方便 agent 完全接管后面的部分(然后随着大家用的越来越熟练可以逐渐进化成让前面的除了沟通外的部分也由 ai 辅助来做),所以设计 harness 其实也就是在做这个“设计抽象和架构”工作。
这块工作是工程师工作中最难做的一部分,架构讨论在研发工作里非常难达成一致,往往大家都要吵架吵很久,最后效率高一点的方式很多时候是老板拍个板;这个工作有一些前人总结出来的经验,可以根据实际的项目节奏选择,但实际基本没法原样完全套用,基本上都要为了项目节奏再进行调整。有本老书管这个类似的情况叫“没有银弹”。
现在各种关于 skills,soul.md,agents.md,自进化,design.md 等等 harness 的讨论是一场扩圈到程序员圈子外的项目通用性架构设计讨论,结合前面的工作经验分析,这些讨论可能最终也不会有个能解决所有问题的结论,大家根据自己的使用需求以及服务场景自己定制,大家各自去考虑自己要做的 trade-off。Agent 是一台精密的仪器,人需要习惯他就是个会来带思考负担的东西。
by @Kaiyi #AI探索站
当时能用的 ai 工具还不多,我们主要用的是 cursor,claude code,code rabbit,规则就是给他们几个做的,我们工程团队每个方向排了一个人维护所有的这些 harness,我当时负责 iOS 端的这块工作,每天会有 30% 的工作时间用来 review code rabbit 根据 mr 和 mr comment 自动产生的一条一条式的记忆,维护每位同事加的 cursor rules,根据之前设计好的代码架构和大家的开发习惯/约定补 rules,在项目里的各种位置思考要不要加一个 rules,这个维护工作现在可以新潮一点的叫法就是 harness 设计。
回到从工程师的工作内容角度看这个事情,首先 Coding Agent 没带来代码运行逻辑上的变化,以前运行在机器上的 if else 现在还是 if else,他改变的是工程师的工作重心,工程师之前的工作宏观来说是两部分,第一部分是分析产品需求、沟通、设计抽象和架构,第二部分是写代码落地,验证以及 review。这两部分之间是由“设计抽象和架构”串联起来的,harness 设计工作的目的就是为了方便 agent 完全接管后面的部分(然后随着大家用的越来越熟练可以逐渐进化成让前面的除了沟通外的部分也由 ai 辅助来做),所以设计 harness 其实也就是在做这个“设计抽象和架构”工作。
这块工作是工程师工作中最难做的一部分,架构讨论在研发工作里非常难达成一致,往往大家都要吵架吵很久,最后效率高一点的方式很多时候是老板拍个板;这个工作有一些前人总结出来的经验,可以根据实际的项目节奏选择,但实际基本没法原样完全套用,基本上都要为了项目节奏再进行调整。有本老书管这个类似的情况叫“没有银弹”。
现在各种关于 skills,soul.md,agents.md,自进化,design.md 等等 harness 的讨论是一场扩圈到程序员圈子外的项目通用性架构设计讨论,结合前面的工作经验分析,这些讨论可能最终也不会有个能解决所有问题的结论,大家根据自己的使用需求以及服务场景自己定制,大家各自去考虑自己要做的 trade-off。Agent 是一台精密的仪器,人需要习惯他就是个会来带思考负担的东西。
by @Kaiyi #AI探索站
今日份的作业是电影级的Cosplay海报,至于是什么电影你别管,成图都是我审过的,不健康的都没发出来。
这个提示词是直接从Nnao Banana那里照搬过来的,相比之下,GPT-Image-2的审美还是要更好一些,人物的高P感是故意用提示词强化的,就是为了区别于真实系,表现得更加浮夸和明媚。
提示词:
{
"subject": {
"描述": "以[xxx]为主体的电影级Cosplay海报,动态姿态;保留原始面部特征并转化为真实人类质感;呈现写真出道氛围,带有亲密日式美感"
},
"style": {
"风格": "高端杂志封面风",
"特征": [
"排版密度高(字体+材质叠加)",
"商业摄影质感",
"信息素氛围(感性吸引力)",
"高光泽",
"高对比度"
]
},
"model": {
"身材": "8.5头身超模比例,S曲线",
"皮肤": "瓷白肌肤,真实质感(次表面散射、毛孔、细绒毛、油润光泽)",
"特征": [
"丰满胸型",
"精致锁骨与颈线",
"强烈女性吸引力"
]
},
"face": {
"基础": "日系缪斯脸型",
"特征": "叠加[xxx]标志性面部特征",
"细节": [
"柔焦眼神",
"水润玻璃唇",
"肌肤通透感",
"眼部高光"
]
},
"pose": {
"姿态": [
"开放且具有吸引力的身体语言",
"带有邀请感的眼神",
"手部动作丰富自然"
]
},
"hair": {
"描述": "[xxx]标志性发型(真实沙龙级呈现,无假发)",
"特征": [
"符合重力与重量感",
"自然碎发",
"结构化定型(轻微反重力效果)",
"背光增强体积感"
]
},
"costume": {
"描述": "高度还原[xxx]原作服装",
"特征": [
"高级定制级材质转译",
"真实奢华面料",
"保留原始设计",
"通过服装与身体结合体现魅力",
"裸露区域带有细腻肌肤光泽"
]
},
"environment": {
"场景": "符合[xxx]设定的环境",
"风格": [
"高预算电影布景",
"结构有序但信息丰富",
"轻微雾气",
"散景效果(bokeh)"
]
},
"composition": {
"构图": [
"竖版海报(2:3)",
"近景到中景",
"浅景深",
"文字作为构图框架",
"人物部分覆盖文字层"
]
},
"lighting": {
"灯光": [
"电影级商业布光",
"冷色环境光(青色)+暖色主光(肤色)",
"头发轮廓光",
"高对比用于印刷质感"
]
},
"typography": {
"排版逻辑": "基于[xxx]世界观推导",
"层级": [
{
"层级": 1,
"内容": "日语主标题(带张力与暗示感)",
"字体": "高对比纤细衬线体,可斜体"
},
{
"层级": 2,
"内容": "[xxx]罗马音名称",
"字体": "中等字重衬线体"
},
{
"层级": 3,
"内容": "英文短叙述/标语",
"字体": "细衬线体"
},
{
"层级": 4,
"内容": "圆形印章/徽章(基于设定)"
},
{
"层级": 5,
"内容": "Jerlin + 期号",
"字体": "极细Didot,宽字距,角落布局"
},
{
"层级": 6,
"内容": "条形码 + 价格标签"
}
],
"混排": "日语 + 平假名 + 罗马字,字重递减",
"系统": "基于网格系统的封面设计"
},
"mood": {
"氛围": [
"梦幻",
"微性感",
"亲密感(恋人视角)",
"欲望张力"
]
},
"negative": {
"避免": [
"文字重复",
"文字阴影",
"发光效果",
"描边"
]
},
"aspect_ratio": "2:3"
}
by @阑夕ོ #AI探索站
这个提示词是直接从Nnao Banana那里照搬过来的,相比之下,GPT-Image-2的审美还是要更好一些,人物的高P感是故意用提示词强化的,就是为了区别于真实系,表现得更加浮夸和明媚。
提示词:
{
"subject": {
"描述": "以[xxx]为主体的电影级Cosplay海报,动态姿态;保留原始面部特征并转化为真实人类质感;呈现写真出道氛围,带有亲密日式美感"
},
"style": {
"风格": "高端杂志封面风",
"特征": [
"排版密度高(字体+材质叠加)",
"商业摄影质感",
"信息素氛围(感性吸引力)",
"高光泽",
"高对比度"
]
},
"model": {
"身材": "8.5头身超模比例,S曲线",
"皮肤": "瓷白肌肤,真实质感(次表面散射、毛孔、细绒毛、油润光泽)",
"特征": [
"丰满胸型",
"精致锁骨与颈线",
"强烈女性吸引力"
]
},
"face": {
"基础": "日系缪斯脸型",
"特征": "叠加[xxx]标志性面部特征",
"细节": [
"柔焦眼神",
"水润玻璃唇",
"肌肤通透感",
"眼部高光"
]
},
"pose": {
"姿态": [
"开放且具有吸引力的身体语言",
"带有邀请感的眼神",
"手部动作丰富自然"
]
},
"hair": {
"描述": "[xxx]标志性发型(真实沙龙级呈现,无假发)",
"特征": [
"符合重力与重量感",
"自然碎发",
"结构化定型(轻微反重力效果)",
"背光增强体积感"
]
},
"costume": {
"描述": "高度还原[xxx]原作服装",
"特征": [
"高级定制级材质转译",
"真实奢华面料",
"保留原始设计",
"通过服装与身体结合体现魅力",
"裸露区域带有细腻肌肤光泽"
]
},
"environment": {
"场景": "符合[xxx]设定的环境",
"风格": [
"高预算电影布景",
"结构有序但信息丰富",
"轻微雾气",
"散景效果(bokeh)"
]
},
"composition": {
"构图": [
"竖版海报(2:3)",
"近景到中景",
"浅景深",
"文字作为构图框架",
"人物部分覆盖文字层"
]
},
"lighting": {
"灯光": [
"电影级商业布光",
"冷色环境光(青色)+暖色主光(肤色)",
"头发轮廓光",
"高对比用于印刷质感"
]
},
"typography": {
"排版逻辑": "基于[xxx]世界观推导",
"层级": [
{
"层级": 1,
"内容": "日语主标题(带张力与暗示感)",
"字体": "高对比纤细衬线体,可斜体"
},
{
"层级": 2,
"内容": "[xxx]罗马音名称",
"字体": "中等字重衬线体"
},
{
"层级": 3,
"内容": "英文短叙述/标语",
"字体": "细衬线体"
},
{
"层级": 4,
"内容": "圆形印章/徽章(基于设定)"
},
{
"层级": 5,
"内容": "Jerlin + 期号",
"字体": "极细Didot,宽字距,角落布局"
},
{
"层级": 6,
"内容": "条形码 + 价格标签"
}
],
"混排": "日语 + 平假名 + 罗马字,字重递减",
"系统": "基于网格系统的封面设计"
},
"mood": {
"氛围": [
"梦幻",
"微性感",
"亲密感(恋人视角)",
"欲望张力"
]
},
"negative": {
"避免": [
"文字重复",
"文字阴影",
"发光效果",
"描边"
]
},
"aspect_ratio": "2:3"
}
by @阑夕ོ #AI探索站
付费看完了 codex 团队的采访, 说下我认为的重点:
- 团队只有 40人,就 1个 pm, 2个designer,其余全是 eng➕少量 researcher。
- 唯一一个 pm 的 routine就是用 codex 来处理用户反馈,issue,排优先级。一小时自动跑完一次,处理 100+issue,大部分 24 小时内修复。
- feature 都是极小团队(2-3 人),甚至单人完成,从规划到发布,再到迭代。
- 几乎没有定期会议了,全是点对点直接沟通,没任何流程,没啥管理成本。
- codex 协助新人 onboard,从电脑配置到项目和上下文同步
- 99% 代码是 codex 生成,每个工程师至少 4个并行 agent。一个在做 code review,一个在实现功能,一个在跑安全审计,一个在生成代码库摘要。
- 团队总leader 自己搞了个automation,每天多次随机选一个代码文件,让 agent 去找隐藏 bug 并提交修复。另一个 automation 每天自动搜索全网用户对产品的讨论,生成营销情报简报。
个人印象最深的地方:
- 我觉得大 leader 如果不做向上管理,唯一那个 pm 的活他自己就能干完…
- 协作成本急剧降低了,因为不需要协作了…大部分跨职能分工协作的活,agent 给你保证了下限,快速迭代的时候可以接受。
- 老外也搞 pr 排行榜…这很中国,有一个每日贡献报告:每天早9点自动汇总前一天所有合入 Codex app 的 commit。
- 还是不够聚焦,anthropic 一千多号人在编程模型和产品的专注度是超过 OpenAI 的,创业公司跟大平台竞争,大平台针对你这个方向的团队人数是没你多的。
by @志达 https://newsletter.eng-leadership.com/p/how-openais-codex-team-works-and #AI探索站
- 团队只有 40人,就 1个 pm, 2个designer,其余全是 eng➕少量 researcher。
- 唯一一个 pm 的 routine就是用 codex 来处理用户反馈,issue,排优先级。一小时自动跑完一次,处理 100+issue,大部分 24 小时内修复。
- feature 都是极小团队(2-3 人),甚至单人完成,从规划到发布,再到迭代。
- 几乎没有定期会议了,全是点对点直接沟通,没任何流程,没啥管理成本。
- codex 协助新人 onboard,从电脑配置到项目和上下文同步
- 99% 代码是 codex 生成,每个工程师至少 4个并行 agent。一个在做 code review,一个在实现功能,一个在跑安全审计,一个在生成代码库摘要。
- 团队总leader 自己搞了个automation,每天多次随机选一个代码文件,让 agent 去找隐藏 bug 并提交修复。另一个 automation 每天自动搜索全网用户对产品的讨论,生成营销情报简报。
个人印象最深的地方:
- 我觉得大 leader 如果不做向上管理,唯一那个 pm 的活他自己就能干完…
- 协作成本急剧降低了,因为不需要协作了…大部分跨职能分工协作的活,agent 给你保证了下限,快速迭代的时候可以接受。
- 老外也搞 pr 排行榜…这很中国,有一个每日贡献报告:每天早9点自动汇总前一天所有合入 Codex app 的 commit。
- 还是不够聚焦,anthropic 一千多号人在编程模型和产品的专注度是超过 OpenAI 的,创业公司跟大平台竞争,大平台针对你这个方向的团队人数是没你多的。
by @志达 https://newsletter.eng-leadership.com/p/how-openais-codex-team-works-and #AI探索站