📢 Gate广场 #NERO发帖挑战# 秀观点赢大奖活动火热开启!
Gate NERO生态周来袭!发帖秀出NERO项目洞察和活动实用攻略,瓜分30,000NERO!
💰️ 15位优质发帖用户 * 2,000枚NERO每人
如何参与:
1️⃣ 调研NERO项目
对NERO的基本面、社区治理、发展目标、代币经济模型等方面进行研究,分享你对项目的深度研究。
2️⃣ 参与并分享真实体验
参与NERO生态周相关活动,并晒出你的参与截图、收益图或实用教程。可以是收益展示、简明易懂的新手攻略、小窍门,也可以是行情点位分析,内容详实优先。
3️⃣ 鼓励带新互动
如果你的帖子吸引到他人参与活动,或者有好友评论“已参与/已交易”,将大幅提升你的获奖概率!
NERO热门活动(帖文需附以下活动链接):
NERO Chain (NERO) 生态周:Gate 已上线 NERO 现货交易,为回馈平台用户,HODLer Airdrop、Launchpool、CandyDrop、余币宝已上线 NERO,邀您体验。参与攻略见公告:https://www.gate.com/announcements/article/46284
高质量帖子Tips:
教程越详细、图片越直观、互动量越高,获奖几率越大!
市场见解独到、真实参与经历、有带新互动者,评选将优先考虑。
帖子需原创,字数不少于250字,且需获得至少3条有效互动
GPT-4满分通过MIT本科数学考试!这套提示词火了
来源:量子位
万万想不到啊,MIT数学考试,被GPT-4攻破了?!
突然有人在最新论文工作中高调宣布:
GPT-4在MIT的数学和EECS(电气工程和计算机科学系)本科学位考试中,表现出的能力完全满足毕业要求。
而且妥妥地拿下满分!
要知道,测出这个结果的不是别人,正是来自MIT和波士顿大学、康奈尔大学的研究团队。
而且强如上一代王者GPT-3.5,在同样的测试中,只成功搞定了三分之一。
论文一出,无数目光迅速被吸引过来。
GPT-4开挂MIT考试
具体来说,GPT-4这次是参与了这样一场测试:
研究团队策划了一个数据集,其中包含4550个问题和解决方案。
这4550个问题和解决方案,来自MIT数学系和EECS的学生获得本科学位,需要学习的课程问题集、期中考试和期末考试。
包括:
6-1:电气科学与工程;
6-2:电气工程与计算机科学;
6-3:计算机科学与工程;
6-4:人工智能与决策;
18-1:普通数学;
18-2:应用数学;
18-3:纯数学;
18-C:数学与计算机科学。
每个专业的详细分类总结
题目统统出自MIT的数据集,从中随机生成228个问题,不涉及图像和已有解决方案的问题。
题目的难度等级由易到难依次为:练习、习题、 期中考试、期末考试、实验和专题。
按答案类型排序,题目的难度由易到难依次为:编程、开放、选择题、数值、表达式和图像。
这一次,参与考试的不只有GPT-4和GPT-3.5,还有StableVicuna-13B、LLaMA-30B和LLaMA-60B。
选择让这4个大模型作为考试参赛选手,原因是它们是“最先进的大语言模型”。
最终考试成绩
通过表格里的数据可以看到,得分最高的是经过调优后的GPT-4,得分率100%;表现最一般的是LLaMA-30B,只拿下了30%的分数。
值得关注的是,原始版本的GPT-4开箱即用,完全不经过调优,在本次MIT考试中也拿到了90%的分数。
调优流程,包括Few-Shot+CoT+Self-critique+Experts。
此外,研究团队还在提示框里进行了工程优化,**具体的“咒语”**如下:
等等,评分人是GPT-4自己?
看到这样的结果,不少网友心生感慨,LLM在数学考试上的进步,未免有些神速了哈。
类似**“小明种了5棵柠檬树,每年从每棵树上得到6个柠檬,10年间他总共得到多少柠檬”**这种。
学了6门MIT本科基础数学课里随机抽取的例题,6门课程每门随机出25道题,再加上一个ACT水平(美国高考)的数据集里的60道题。
总计210道题,AI全部答对。
因为当时的评测中,Codex负责读写,并不包括求解。
所以,这一回GPT-4表现奇佳,怎一个妙字了得~
主要有2大槽点。
第一个值得质疑一番的,就是OpenAI的训练数据集没有完全公布。
这也就意味着,无法证明数据集中的4550个问题和解决方案,在GPT-4的训练集中不存在。
换句话说,如果GPT-4在预训练阶段已经接触到了这次的考题们,那最终拿下完美得分,就没什么好惊喜的了。
也难怪乎有网友毫不客气地yygq,认定GPT-4拿到这样的结果,一定是数据集已经包含在训练数据里了。
定睛一看,在论文的第2.6节有一句很关键的点:
团队在数据集上微调开源大模型,“给定问题Q、基本事实解S和LLM答案A,我们使用GPT-4自动对模型响应进行评分”。
实际操作上,就是每个大模型生成这次考试的答案,然后派出GPT-4打分,分值在0-5之间。
所以给GPT-4打出满分的,实际上是GPT-4自己。
啊这……很难说没有王婆卖瓜自卖自夸的嫌疑。
到底什么算“好的提示”呢?似乎无法定义。
One More Thing
一个小小的彩蛋:
整个测试中,基本上可以在笔记本电脑上部署运行的StableVicuna-13B,也有48%的得分率。
让人不得不陷入一些关于模型规模与能力相关性的思考。
参考链接:
[1]
[2]
[3]
[4]