跳到正文

#编码

今日 0 条
9月12日周四
8月13日周二
8月7日周三
7月24日周三
7月18日周四
  1. Mistral AI70

    Mistral 与 NVIDIA 联合发布 12B 开源模型 Mistral NeMo

    Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。

    推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。

7月16日周二
  1. Mistral AI62

    Mistral 发布 Mamba 架构编码模型 Codestral Mamba

    Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。

    推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。

7月11日周四
7月1日周一
6月18日周二
  1. OpenAI News26

    Paf 全公司采用 ChatGPT Enterprise,工程师用 custom GPTs 提升开发效率

    Paf 在全公司采用 ChatGPT Enterprise,工程师每天使用 custom GPTs 加速日常开发任务,并将 ChatGPT Enterprise 集成到 grit:lab 编程学院(gritlab.ax),以 AI 增强的系统架构思维培养下一代软件开发者。目前 Paf 有 70% 的员工活跃使用 ChatGPT Enterprise,覆盖财务、HR、市场和客户支持等业务团队。

5月29日周三
5月24日周五
  1. Hugging Face Blog44

    CyberSecEval 2:Meta 推出的大语言模型网络安全风险与能力综合评测框架

    Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。

4月29日周一
4月17日周三
  1. Mistral AI72

    Mistral AI 开源发布 Mixtral 8x22B 稀疏 MoE 模型

    Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。

    推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。

4月16日周二
4月9日周二
3月21日周四
3月15日周五
2月28日周三
2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

1月30日周二
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。

11月7日周二
10月27日周五
9月11日周一
8月25日周五
  1. Hugging Face Blog83

    Code Llama 发布:Llama 2 代码特化系列模型接入 Hugging Face 生态

    Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。

    推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。

8月22日周二
8月8日周二
7月3日周一
  1. Hugging Face Blog63

    Hugging Face 教程:用 WizardCoder-15B 在 Node.js 中搭建文本生成网页应用

    Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。

    推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。

5月9日周二
5月4日周四
2月7日周二
  1. Hugging Face Blog49

    生成故事:AI 辅助游戏开发系列 #5 —— 用 ChatGPT 写游戏剧情

    Hugging Face 的 AI 游戏开发系列第五篇用 ChatGPT 为一个 5 天开发周期内的农场游戏生成故事内容,流程包括生成故事摘要、多轮精炼、撰写并扩展游戏内物品描述。文章指出语言模型易复刻《星露谷物语》等既有故事、长内容质量漂移并陷入重复,且直接使用生成内容可能带来法律、伦理和商业风险,建议将其用于头脑风暴、人工撰写最终内容。

1月2日周一
11月2日周三
5月24日周二
3月15日周二
12月8日周三
8月10日周二
7月7日周三