BanglaVeilGuard は、6 つの形態のバングラの安全ギャップをテストします
新しい論文では、BanglaVeilGuard を紹介しています。これは、標準形式、ローマ字形式、コード混合形式、ノイズの多い形式、方言形式でバングラ語モデルをテストするように設計されたベンチマークおよび軽量のプロンプト ガードです。著者らは、評価で攻撃の成功率が大幅に低いことを報告していますが、ガードが一部の良性の攻撃を過度に拒否していることも発見しました。
毎日更新1797 検証済みのストーリー
製品の発売、政策の変更、安全性研究、業界の動向についてソースチェックされた AI の報道が、非営利教育チームによって平易な英語で説明されます。
すべてのストーリーは、入手可能な最強の証拠、つまり入手可能な場合はオリジナルの情報源、それ以外の場合は明らかに帰属が明記された報道にリンクしています。
何が起こったのか、なぜそれが重要なのか、何を観るべきなのかを、専門用語を使わずに説明します。
信号が薄い場合は、フィードをパディングするだけで何も公開しません。
誇大宣伝を追わずに AI を理解する必要がある人向けに、出典を確認した AI ストーリーを最新のものから順に紹介します。
新しい論文では、BanglaVeilGuard を紹介しています。これは、標準形式、ローマ字形式、コード混合形式、ノイズの多い形式、方言形式でバングラ語モデルをテストするように設計されたベンチマークおよび軽量のプロンプト ガードです。著者らは、評価で攻撃の成功率が大幅に低いことを報告していますが、ガードが一部の良性の攻撃を過度に拒否していることも発見しました。
Cloudflareの幹部らはChosunbizに対し、同社のネットワーク上のAIエージェントのトラフィックが前年比1700%以上増加していると述べ、企業に対しアクセス制御を強化し、MCP接続を管理し、ポスト量子暗号に備えるよう促した。トラフィックの数値、手法、セキュリティ テストの結果は独立したものではありませんでした…
Technology.org は、英国とウクライナが防衛と AI のパートナーシップに署名し、英国の研究者がウクライナのアベンジャーズ AI ラボとその戦場データ プラットフォームにアクセスできるようにしたと報じています。報告書によると、最初のプロジェクトは軍事施設のセンシングとドローン用の低電力チップに焦点を当てているとのことですが、主張はそうではありません…
Chosunbiz の報道によると、韓国は主要な公共サービスを AI と統合し、多言語の災害情報を提供し、省庁固有のシステムを導入し、すべての公務員に AI トレーニングを義務付ける計画だという。
新しい arXiv ベンチマークは、さまざまな命令、分子表現、および 8 つのタスク カテゴリにわたって化学に焦点を当てた大規模言語モデルを評価し、大幅なプロンプト感度、表現依存性、不均一なパフォーマンスを報告します。
American Bazaarの報道によると、キタ氏は貸し手向けのAIを活用した信用評価を拡大するために、BoxGroupとY Combinatorが主導するシードラウンドで450万ドルを調達したという。同社は、自社のテクノロジーがいくつかの市場で使用されており、1億3,000万ドルを超える融資額を処理していると述べていますが、それらの運用上の申し立ては…
プレプリントでは、言語モデルのパイプラインが劣化した入力を処理する際に、中間証拠が引き続き使用可能かどうかをテストするための尺度である証拠状態の信頼性を紹介しています。 GLM-5.2 を使用した 1 つの制御された評価では、パーサー有効な出力は持続しましたが、ステージの成功は低下しました。
新しい arXiv 研究では、11 の安全性データセットにわたる 53 の言語モデルを評価し、モデルの強度は危害カテゴリーによって大きく異なる一方、会話の安全性は未解決のままであると報告しています。
サウスチャイナ・モーニング・ポストは、Xiaomiが利益の減少と部品コストの上昇にもかかわらず、スマートフォンAI、大規模言語モデルの高速化、自動運転用の新しいXringチップを発表したと報じた。
ToSCA は、戦略的選択をトークンレベルの応答生成から分離する階層的な強化学習フレームワークを提案します。著者らは、日常会話や感情サポートに関する会話において、いくつかのベースラインに対して戦略の選択と応答の質が向上したと報告しています。
Fortune は、Ramp の決済処理業者のデータを引用し、リリースから 2 か月後に Claude Fable 5 が Anthropic モデルに対する企業支出の 11% を占めたと報告していますが、その後そのシェアは失速しています。報告書は、このパターンにより最先端の AI 企業が価格競争をより積極的に行うよう圧力をかける可能性があると述べていますが、Ramp は…
arXiv の調査では、言語モデル システムが以前に生成したドキュメントを検索で取得するときに失敗パターンに陥る可能性があると報告しています。著者らのシミュレーションでは、1,528 回の実行のうち 79.6% が、論文で「RAG 崩壊」と呼ばれるもので終了しました。
毎週 1 回の有益なブリーフィング
今週の検証済み AI ニュース、オリジナル データ、便利なツール、おすすめの学習情報、最新の AI ジョブを入手します。
AI の専門家を雇いますか、それとも便利な AI 製品を立ち上げますか?それを学び、行動するためにここに来た人々の前に置きます。
AI の仕事を投稿する AIツールを提出する