Sections
Text Area
研究領域
以人為本為基準
Image
Image
Text Area
「基準測試」(Benchmark)是一種通過標準化方法衡量產品性能的工具,旨在幫助用戶對不同產品進行客觀比較和評估。例如,「大規模多任務語言理解」基準測試提供了量化數據,證明了語言模型的性能在過去幾年中已實現飛越式提升。在老年護理領域,人工智能和機器人技術的基準測試尤為重要,它們是確保新技術安全性和有效性的關鍵手段。
然而,隨著人工智能的快速發展,基準測試也面臨著新的挑戰。一方面,得益於語言模型性能的大幅提升,許多新產品在現有的基準測試中都已表現得足夠出色,這使我們很難分辨出不同模型的優劣,也不容易觀察模型表現的逐步提升 。更重要的是,許多新模型在訓練過程中已接觸過現有的基準測試數據,導致其在測試中的表現可能無法真實反映其實際能力。因此,市場亟需更新、更具挑戰性的基準測試。
目前,許多以人為本的基準測試通過對比人工智能與人類在標準化測試中的表現來評估人工智能。這種比較是一個必要的起點,但它尚未能充分考慮人工智能與人類在真實情境中的互動。在推動老年護理技術發展的道路上,為了確保技術的有效性,我們將開發涵蓋真實互動場景的基準測試;同時,為了保障技術的安全性,我們將確保這些基準測試具備足夠的挑戰性——任何涉及老年人護理的技術,都需在其應用框架內達到高標準,以確保其可靠性和實用性。