随着大模型推理能力的持续跃升,人工智能的应用边界正从“内容生成”向“任务执行”深度拓展。从代码编写、数据洞察到文档处理与业务审核,智能体已开始渗透企业核心场景,展现出重塑工作流程的潜力。然而,当技术从实验室走向真实生产环境,一系列挑战逐渐浮现:企业需要的不仅是偶尔完成任务的AI工具,而是能够长期稳定运行、结果可追溯、过程可审计的智能系统。
澳门大学信息学院教授黄辉在接受专访时指出,当前智能体发展面临的核心矛盾已从“能力不足”转向“可靠性缺失”。在数学推理、代码生成等封闭任务中,大模型已展现强大实力,但进入复杂业务场景后,企业关注的焦点转向系统稳定性——智能体不仅需要完成任务,更需确保结果可信、过程透明。黄辉强调:“模型或许能设计出策略,但执行环节的偏差、信息动态变化或工具调用异常,都可能导致任务偏离目标。真正的可靠性需要系统具备自我纠错、路径调整和重复执行的能力。”
任务可验证性正成为智能体落地生产环境的关键门槛。黄辉分析,与聊天模型的信息风险不同,智能体直接操作企业系统时,错误可能转化为真实的业务损失。例如,在财务审核场景中,单个环节的微小误差可能随流程延长被放大,最终影响决策结果。因此,可验证性不是附加功能,而是智能体进入生产流程的基础条件。他特别提到,长流程任务中的上下文管理是另一大挑战:依赖聊天上下文保存信息易导致遗漏或污染,行业正探索结构化记忆管理方案。
工程体系的完善被视为智能体从“演示级”迈向“生产级”的核心支撑。黄辉指出,当前行业对智能体的期待存在认知偏差:演示环境中连续执行几十步操作并不困难,但要在万次重复运行中保持稳定,并实现故障恢复与责任追溯,仍需补齐工程能力短板。他举例说明,模型自我纠错机制存在局限性——重新检查输出可能掩盖正确答案,而代码测试、规则校验或人工反馈等外部验证手段更为可靠。多智能体协同虽被寄予厚望,但信息错位与终止机制缺失已成为常见失败原因。
在企业部署策略上,黄辉建议垂直行业优先聚焦编排层与数据资产建设,而非盲目投入大模型研发。他解释道,基础模型正快速商品化,真正形成差异化的往往是行业知识库、规则体系及测试集等专有资产。例如,医疗领域可通过沉淀临床案例数据构建评估体系,金融行业则可利用历史交易记录优化风控模型。具体落地路径上,企业应从高频、结果可量化、价值可衡量的任务切入,通过通用模型与工具编排进行验证,仅在通用方案无法满足需求时再考虑定制化开发。
市场数据印证了智能体发展的“热投入、低渗透”现象:工业AI智能体市场规模虽从2025年的148亿元增至2026年的204亿元,但渗透率仅从7.4%微升至7.9%。黄辉认为,2026年将成为智能体从“对话辅助”转向“任务执行”的关键转折点,但行业信任的建立无法依赖演示或基准测试,而需通过一个个边界清晰、结果可验证的场景实现经济价值转化。他提醒,部分企业存在将聊天机器人或固定流程重新包装为“智能体”的现象,判断AI价值的标准应回归业务本质——能否在可控风险下持续改善已定义指标。




