View / Create
Answer
YOUR GOAL
Master of DeepSeek与中国AI的崛起
mei 硬件不够算法来凑的智慧
Jul 9
mei 极简主义与混合专家模型
专家巧组合,智慧又高效,DeepSeek MoE,AI新浪潮!
mei 独创的多头潜在注意力机制MLA
mei 什么是混合专家模型MoE
Jun 18
mei Pocket MoE Buddy
mei 对齐技术与强化学习的魔力
Jun 17
思考过程:DeepSeek-R1在回答问题时会展示自己的“思考过程”,有时候它还会像人类一样在心里纠结、推翻自己的前一个想法。
传统的密集模型会运行所有参数,而MoE模型在处理单个任务时会怎么做?
你喜欢会展示“思考过程”的AI吗?
DeepSeek大模型采用的“MoE”架构,全称是什么?
算法和硬件哪个对AI更重要?
在数学和奥数等逻辑推理任务中,DeepSeek-R1的策略更偏向于以下哪种?
为了解决旧款显卡之间通信速度慢的问题,DeepSeek的工程师做了什么?
MLA机制通过压缩什么数据,将显存占用惊人地降低了93%?
DeepSeek-R1模型在回答问题时,屏幕上会出现什么独特的文本框?
DeepSeek-R1在不依赖大量人工标注的情况下,主要通过什么技术让模型学会自主推理?
DeepSeek提出的“MLA”机制,主要解决了大模型运行中的什么痛点?