朗慧科技 · 新闻中心

公司新闻

关注朗慧科技最新动态,洞察数据行业发展趋势

从Terminal Bench 3.0看AI Agent能力鸿沟:29.5个百分点背后的训练数据革命
头条
新闻资讯
2026-08-08

从Terminal Bench 3.0看AI Agent能力鸿沟:29.5个百分点背后的训练数据革命

以GLM-5.2为公开样本,Terminal Bench 3.0揭示了国产模型与SOTA之间29.5个百分点的真实差距。差距的根源不在编码能力,而在专家环境中的长程诊断、工具执行与验证闭环。本文从长沙朗慧首席科学家视角,深度拆解八类失败簇与训练数据解决方案。

#Terminal #Bench #3.0 #AI #Agent #训练数据定制化 #GLM-5.2 #智能体评测 #大模型能力差距
训练数据的范式跃迁:从“对话消息”到“可执行专家环境”
新闻资讯
2026-08-08 • 朗慧科技

训练数据的范式跃迁:从“对话消息”到“可执行专家环境”

Terminal Bench 3.0提出训练数据计数单位应从“消息”升级为“可执行环境”。本文深度解析四座能力工厂的数据设计、9:1拒收交付比例的质量门禁、以及可审计最佳实践轨迹的交付标准,探讨训练数据定制化如何成为大模型能力突破的关键路径。

#训练数据范式 #可执行环境 #专家轨迹 #后训练数据 #TB3数据方案 #AI语料构建
2026年8月全球AI大模型前沿洞察:Agent能力、开源换道与训练数据新基建
新闻资讯
2026-08-08 • 朗慧科技

2026年8月全球AI大模型前沿洞察:Agent能力、开源换道与训练数据新基建

2026年8月,全球AI大模型行业告别单纯参数竞赛,转向深度推理、自主Agent、物理世界模型与具身机器人四大主线。本文从长沙朗慧首席科学家视角,系统性分析Qwen3.8-Max、DeepSeek-V4-Flash、Claude Fable 5、GPT-5.6等最新模型进展,洞察开源换道、成本战升级与训练数据新基建三大趋势。

#2026年8月AI前沿 #Qwen3.8-Max #DeepSeek-V4 #Claude #Fable #5 #GPT-5.6 #Agent模型 #开源大模型 #训练数据
专家级证据闭环:朗慧科技如何为AI提供高质量编程评测语料
新闻资讯
2026-08-06 • 朗慧科技

专家级证据闭环:朗慧科技如何为AI提供高质量编程评测语料

当Kimi K3论文强调评估-数据-RL闭环,GPT-5.6 Sol的Ultra模式需要高质量失败case驱动改进——高质量专家轨迹语料已成为AI智能体进化核心燃料。朗慧科技以完整专家级证据闭环体系,从专家真实解题到三段递进验收,为AI编程评测提供高质量语料。

#专家级证据闭环 #高质量语料 #编程评测语料 #专家轨迹 #朗慧科技 #数据标注 #十二步准入流程 #多轮任务 #评分标准 #Rubric校准 #三段递进验收 #Kimi #K3 #GPT-5.6 #AI训练数据
全球AI编程格局2026:大模型Agent竞赛与中国的突围之路
新闻资讯
2026-08-06 • 朗慧科技

全球AI编程格局2026:大模型Agent竞赛与中国的突围之路

2026年8月,Meta发布Muse Code挑战Anthropic和OpenAI;Kimi K3以2.8万亿参数开源成全球首个3T级开源模型;清华VeriLoop Coder-E1以27B实现85.20 SWE-bench Verified。本文全景解析全球AI编程格局、技术路线分野和中国AI突围路径。

#AI编程格局 #2026 #Kimi #K3 #2.8万亿参数 #GPT-5.6 #Sol #Ultra模式 #Claude #Fable #5 #Muse #Code #Meta #开源模型 #中国AI突围 #Terminal-Bench #朗慧科技 #高质量语料
从SWE-bench到FrontierSWE:2026年AI编程基准评测的范式跃迁与差异化方向
新闻资讯
2026-08-06 • 朗慧科技

从SWE-bench到FrontierSWE:2026年AI编程基准评测的范式跃迁与差异化方向

当GPT-5.6 Sol在Terminal-Bench 2.1达88.8%,Claude Fable 5以80.3%领跑SWE-Bench Pro,VeriLoop Coder-E1以27B实现85.20 SWE-bench Verified——传统编程评测区分度正在消失。本文深度解析八大独特题型、实质差异判定和各领域差异化重点。

#SWE-bench #Terminal-Bench #FrontierSWE #编程评测 #范式跃迁 #差异化 #八大独特题型 #实质差异判定 #Kimi #K3 #GPT-5.6 #Sol #Claude #Fable #5 #VeriLoop #朗慧科技 #评测语料
Coding Agent高难题七大领域全景解析:2026年AI编程智能体的能力边界与专家图谱
新闻资讯
2026-08-06 • 朗慧科技

Coding Agent高难题七大领域全景解析:2026年AI编程智能体的能力边界与专家图谱

2026年8月,Meta发布Muse Code,AI编程Agent赛道形成四强格局。当SWE-bench分数趋近天花板,高难度工程问题评测需要全新领域分类体系。本文深度解析Coding Agent七大出题领域、专家配置标准和差异化重点,为AI编程智能体能力评估提供系统性框架。

#Coding #Agent #高难题领域 #七大领域 #AI编程智能体 #SWE-bench #专家图谱 #客户端交互 #分布式系统 #数据库工程 #云基础设施 #软件安全 #朗慧科技 #AI评测 #专家需求
AI智能体任务标注:行业专家如何为AI构建高质量训练轨迹
新闻资讯
2026-08-06 • 朗慧科技

AI智能体任务标注:行业专家如何为AI构建高质量训练轨迹

2026年8月,AI智能体正从'能用'迈向'好用'的关键拐点。当SWE-bench Verified排行榜上的分数越来越难以突破时,业界终于意识到:决定智能体上限的,不是模型架构的微调,而是训练数据的质量——尤其是来自行业专家的真实工作轨迹。朗慧科技以13大行业场景矩阵、6步标注流程和严格质量门槛,为AI大模型训练提供可核验、可复算的高质量专家轨迹语料。

#AI智能体 #任务标注 #训练轨迹 #行业专家 #SWE-bench #朗慧科技
从Chat到Agent Loop再到Graph Engineering:2026年AI智能体范式跃迁
新闻资讯
2026-08-06 • 朗慧科技

从Chat到Agent Loop再到Graph Engineering:2026年AI智能体范式跃迁

2026年7月,OpenClaw的Peter Steinberger发出了一则引发全行业讨论的帖子:'我们还在谈Loop,还是已经转向Graph?'几周之内,'Graph Engineering'从一个概念词变成了Agent圈最热门的工程范式。朗慧科技深度解析这场范式跃迁对高质量语料建设意味着什么。

#Graph #Engineering #Agent #Loop #范式跃迁 #多Agent协作 #朗慧科技
专家级工作空间:多文件协作场景下AI工具的真实业务实践
新闻资讯
2026-08-06 • 朗慧科技

专家级工作空间:多文件协作场景下AI工具的真实业务实践

当AI编程工具从'辅助编码'升级为'重构开发流程的核心载体'时,一个关键问题浮出水面:AI智能体在真实业务场景中到底能不能打?答案藏在'Workspace'——专家级工作空间的设计中。朗慧科技深入解构多文件协作场景下AI工具的真实业务实践。

#Workspace #多文件协作 #Trae #Work #Cursor #业务实践 #朗慧科技
前沿AI数据基础设施提供商

需要高质量的AI训练数据

朗慧科技拥有九大领域专家级数据标注团队,为您的AI模型提供精准、可靠的高质量数据集

数据安全保障
7×24小时响应
15年行业经验
200+专业团队