您的位置:首页 > 互联网

mosaic英伟达「击败GPT-4o、仅次于o1!英伟达重磅开源超强大模型--Nemotron」

发布时间:2024-10-17 17:53:25  来源:互联网     背景:

声明:本文来自于微信公众号 AIGC开放社区,作者:AIGC开放社区,授权转载发布。

全球AI领导者英伟达(Nvidia)开源了超强大模型——Llama-3.1-Nemotron-70B-Instruct。

根据测试数据显示,这个模型已经击败GPT-4o、GPT-4turbo、Gemma-2、Gemini-1.5、Claude-3.5sonnet等140多个开闭源模型,仅次于OpenAI发布的最新模型o1。

Nemotron的基础模型是基于Llama-3.1-70B开发而成,这个没什么新奇。但在训练的过程使用了一种新的混合训练方法,将Bradley-Terry和Regression一起用于训练奖励模型。

值得一提的是,英伟达把Nemotron的训练数据集也开源了,这对于开发同类型或超过Nemotron的模型非常重要,因为这个是使用混合训练方法的关键所在。

开源地址:https://huggingface.co/nvidia/Llama-3.1-Nemotron-70B-Reward

数据集:https://huggingface.co/datasets/nvidia/HelpSteer2

在线demo:https://huggingface.co/chat/

有网友表示,英伟达热衷于不断开源超强模型,一方面有大量资金资助他们的科研人员研发,另外主要目的还是为了卖GPU以及培养开发生态。而Meta依托他的社交帝国,在商业化和资金方面都不愁。

最愁的便是那些大模型初创企业了,钱拼不过这些巨头,商业落地和名气更不用提。所以,很多小企业可能会因为巨头的碾压,很快会出现资金断裂等各种问题。

很高兴看到AI领域的竞争,正在以惊人的速度推动行业向前发展。

这可是重磅开源。

为了新模型,买两个4090爽一下吧。

模型是免费的,但运行的硬件可不免费啊。

我正在测试这个模型,我是一个高级AI用户说说使用心得:在商业写作方面,似乎比Claude3和ChatGPT聪明一些。但它依然会犯一些错误,相比于普通的3.170b Instruct,确实更聪明。

Nvidia可以以1000倍更低的成本实现这一点。如果Nvidia真的原意这么做,那么将无人能与之竞争。

创新混合训练方法

在训练大模型的过程中,为了确保模型在实际使用中能够准确地理解并遵循用户的提示指令,准确进行翻译、文本生成、问答等任务,奖励模型发挥了很重要的作用,主要通过为模型的输出打分,指导模型生成更高质量的回答来实现。

目前,主流的奖励模型方法主要有Bradley-Terry和Regression两种:Bradley-Terry风格的奖励模型起源于统计学中的排名理论,通过最大化被选择响应和被拒绝响应之间的奖励差距。这种方法强调在给定的提示下,用户会选择哪个响应,从而为模型提供了一种直接的、基于偏好的反馈。

英伟达grd

Regression则借鉴了心理学中的评分量表,通过预测特定提示下响应的分数来训练模型。这种方法允许模型对响应的质量进行更细致的评估,但可能不如基于偏好的方法直观。

但这两种方法都有明显的缺点,Bradley-Terry需要用户在两个响应中选择一个;而回归风格的模型需要评分数据,用户需要为每个响应打分才能帮助模型提升性能。所以,英伟达直接把两个模型的优点放在一起使用来解决这个难题。

比亚迪海鸥多少钱

首先是需要开发一个包含评分和偏好注释的数据集HELPSTEER2-PREFERENCE。研究人员是在HELPSTEER2基础上添加偏好注释。

这些偏好注释不仅包括用户在两个响应中选择一个的偏好方向,还包括用户对这种偏好的强度评分。为了确保数据的质量和可解释性,还要求注释者为他们的偏好提供书面说明。

在训练这种新型混合方法时,研究人员使用AdamW优化器来训练模型,通过引入权重衰减和梯度裁剪来提高训练的稳定性和效率。

为了进一步提高模型性能,使用了ExPO在训练过程中对模型的权重进行外推,可以进一步提高模型的性能。可以使模型在训练时更加关注那些差异较大的响应对,从而提高模型的区分能力。

此外,研究人员还进行了广泛的超参数搜索,以找到最佳的学习率和KL惩罚项。这些超参数对于模型的训练至关重要,因为它们直接影响到模型的收敛速度和最终性能。

iphone12pro和华为mate40pro跑分

HELPSTEER2-PREFERENCE数据集

为了开发这个多元化满足新的混合训练方法数据集,在数据注释的过程中,每一对回应都经过3—5名标注者的评价。这些标注者需要从多个维度对每个回应进行评分,包括有用性、准确性、连贯性、复杂性和冗长程度等。为了更好地理解背后的原因,标注者还需要提供简短的文字说明,解释为何选择了某个回应作为更好的答案。这种方法不仅增强了数据的透明度,也为后续分析提供了丰富的上下文信息。

库克让苹果市值

研究人员还使用了严格的数据预处理步骤来保证数据质量。例如,他们会识别出每个任务中相似度最高的三个偏好注释,然后取这三个注释的平均值并四舍五入到最接近的整数,以此作为该任务的整体偏好得分。

同时,为了排除那些标注者意见分歧较大的样本,研究人员们会过滤掉那些注释之间差异超过一定范围的任务。这些措施共同作用,有效提升了数据的可靠性和一致性。

特斯拉德国工厂计划每年生产50万辆电动汽车

根据测试数据显示,使用HELPSTEER2-PREFERENCE数据集训练的模型性能非常强,在RewardBench评测中达到了94.1的高分,超过了同期几乎所有其他模型的表现。


返回网站首页

本文评论
小米13 Ultra官宣定档:4月18日发布_小米13号发布会有什么
快科技4月12日消息,迟迟没有动静的小米终于官宣了,小米13 Ultra发布会定档4月18日19:00召开。这是小米联合徕卡打造的第二款超大杯机型,影像方面是最大的亮点,官方称之为小米影...
日期:04-12
免税版iPhone 14 Plus售价6790元 便宜200元「苹果13免税后多少钱」
中关村在线消息:iPhone 14 Plus已经正式发布,首销当日即破发,被评价为最不保值的苹果机型。海南免税店起售价为6790元,256GB售价7665元、512GB售价9410元。对比官方售价,便宜200...
日期:10-20
你贡献了几件 国家邮政局:“双11”当天快递业务量达6.39亿件_国家邮政局双十一
快科技11月12日消息,从国家邮政局官方微信公众号获悉,2023年11月11日当天,全国邮政快递企业共揽收快递包裹6.39亿件,是平日业务量的1.87倍,同比增长15.76%。三星电子芯片和高通齐...
日期:11-12
工信部发布Q2电信服务质量通告 申诉数量环比上升3.0%
日前, 工业和信息化部发布《关于电信服务质量的通告(2020年第3号)》,从电信用户投申诉情况、电信服务监管情况、经营及消费提示等三个方面,对2020年第二季度电信服务质量有关情况...
日期:08-01
国家邮政局:2023年我国快递业务量比去年提前39天超千亿件_2021年邮政快递发展
10月23日 消息:国家邮政局快递大数据平台实时监测数据显示,10月23日上午7时39分,2023年我国第1000亿件快件产生,比2022年达到千亿件提前了39天时间。小米civi系列新品civi1s正...
日期:10-23
特斯拉回应降价:在成本控制的基础上 最大化让利给消费者「特斯拉变相降价」
(原标题:特斯拉回应降价:在成本控制的基础上 最大化让利给消费者) 新京报贝壳财经讯(记者林子)8月14日,对于此次车辆降价原因,特斯拉...
日期:08-15
非创始版用户可转单 小米SU7创始版第二轮追加开售
3月31日晚,雷军再次引爆车迷热情,他宣布,由于在小米SU7创始版的首轮定购过程中,系统成功识别并拦截了部分异常及黄牛订单,因此决定启动第二轮惊喜追加销售。雷军透露,第二轮销售将...
日期:04-01
选择权终于交还用户 特斯拉将取消强制单踏板模式_特斯拉会取消单踏板模式吗
【】4月10日消息,特斯拉的强制单踏板模式一直备受争议,特斯拉发布了最新的OTA说明,取消了强制单踏板模式,车主可以自由选择动能回收的强度。盒马实体店几点开门标准:提供最大限度...
日期:10-03
NASA:新型登月火箭一旦错过6日发射窗口,首飞可能推迟至10月_nasa公布登月新计划
【环球时报综合报道】因发动机故障推迟至北京时间9月4日凌晨发射的美国“太空发射系统(SLS)”重型火箭,再度因为燃料泄漏问题“临阵”取消首飞任务。美国国家航空航天局(NASA)的...
日期:09-19
年度旗舰小米13现身跑分:骁龙8 Gen2性能调教给力!安卓
消息称小米13系列有望在下周发布,携手MIUI 14系统一同登场。iphone 14新技术经查,在GeekBench 5上已经出现了小米13的身影,型号识别为2211133C。这款设备还拥有12GB RAM,运行基...
日期:11-28
诺基亚新105功能机国行上架:2G通话15小时,售价139元_诺基亚105联通
  8月6日消息 不久前,诺基亚发布了新款功能机105,主打通话(2G),官方称“从日出打到日落”。现在这款商品已经上架京东,售价为139元。   据介绍,新105采用了经典的人体工程...
日期:05-20
海尔智家价值「行业最高!海尔智家获两项国家级荣誉」
  近年来,科技创新驱动发展成为了推动国家经济高质量增长的关键因素。在此背景下,各行各业都致力发展高新科技,以创新驱动产业升级。那么,哪些企业的科技成果更显著呢?  近日...
日期:06-26
小鹏汽车:今年实现XNGP全国主要城市路网全覆盖_小鹏全国多少门店
快科技1月31日消息,在小鹏智驾新春启动发布会上,小鹏汽车立下了新目标:2024年内实现XNGP全国主要城市路网全覆盖、面向全球开始研发高速NGP,2025年面向全球开始研发XNGP。睿米f...
日期:01-31
1.74英寸炫彩大屏 小米手环8Pro售价399元「xmsho8hm小米手环」
通信世界网消息(CWW)2023年8月14日,小米召开第四次雷军年度演讲,这次主题是“成长”。随着成长的话题也一同发布了 “ 大,不同 ” 的小米手环8 Pro。这次小米手环8 Pro带来了...
日期:08-15
2020年IDC中国视频会议与协作市场跟踪报告_IDC:2019 年中国视频云市场规模达 46.2 亿美元,同比增长 46.3%
  7 月 27 日消息,IDC 最新发布的《中国视频云市场跟踪(2019 下半年)》报告显示,2019 年中国视频云市场规模达到 46.2 亿美元,同比增长 46.3%。其中,视频云解决方案市场增速...
日期:07-14
Pika安卓ios下载地址 AI视频生成免费APP最新版_pika pink安卓下载
Pika是一款基于人工智能技术的应用程序,旨在帮助用户轻松、快速地创建个性化、有趣的短视频内容。它能够从用户提供的素材中生成独特精彩的短视频,满足用户的创作需求。同时Pi...
日期:12-01
瑞幸咖啡2023年第三季度总净收入达72亿元 同比增长84.9%_网易科技_瑞幸咖啡2021营收
11月1日,瑞幸咖啡(OTC:LKNCY)公布2023年第三季度财报。财报数据显示,瑞幸咖啡第三季度总净收入为72.000亿元人民币,同比增长84.9%。2023年第三季度瑞幸咖啡在美国会计准则(GAAP)下营...
日期:11-02
新能源超级充电站「超充,新能源车的下个赛点」
在近一周的密集预告之后,宁德时代的首次线下发布会终于在昨天召开。在这次发布会上,宁德时代正式发布了,全球首款采用磷酸铁锂材料并可实现大规模量产的超充电池——神行超充电...
日期:08-18
强联智创获评国家级专精特新‘小巨人’企业称号_北京强联智创公司有多少人
7月14日,北京市经信局发布第五批专精特新‘小巨人’企业公示名单,强联智创®等243家企业上榜。据悉,专精特新是国家为推进中小企业专业化、精细化、特色化、新颖化发展之路,增强...
日期:07-28
号称史上最强芯片,英伟达新一代BlackWell GPU问世_英伟达新款
通信世界网消息(CWW)美国当地时间3月18日,芯片巨头英伟达的年度技术峰会GTC2024大会在加州圣何塞开幕。英伟达CEO黄仁勋发表名为“见证AI的颠覆时刻”的主题演讲。黄仁勋宣布推...
日期:03-19